Sider med ekstra påfyll

mandag 7. januar 2019

Problemet med koroplete kart

Koroplete kart er populære for å vise fram statistikk om forskjellige steder. Poenget med et koroplet kart er at du fargelegger forhåndsdefinerte områder, som f.eks. kommuner eller grunnkretser, med en farge basert på en verdi i det området. Kommuner med høyere gjennomsnittsinntekt får en sterkere blåfarge emns kommuner med lavere inntekt får en svakere farge.

Den vanligste (og viktigste) kritikken av koroplete kart, er at de favoriserer enheter (sånn som kommuner, fylker, bydeler) med stort areal over enheter med lite areal.

Skjermdump: https://www.reddit.com/r/The_Donald/comments/
932uy9/holy_hell_look_at_all_that_red/
Det ble faktisk gjort et nummer ut av dette i reddit-gruppen til Trump-tilhengere (jeg fikk vite dette via Twitter-kontoen til Joshua Stevens).
Tittelen på reddit-innlegget er HOLY HELL, LOOK AT ALL THAT RED!!!

(Kartet er interaktivt og laget av New York Times)

I følge dette kartet kan det virke som at Donald Trump vant presidentvalget i 2016 helt suverent. Det gjorde han ikke. Fargene på kartet viser hvor mange prosent av de stemmeberettigede som stemte på Trump og Clinton. Blått så stemte flere på Clinton enn på Trump, sterkere blåfarge, større prosentandel stemte på Clinton. De knallrøde områdene er altså steder hvor en ganske høy prosentandel stemte på Trump.

Hva er så problemet? Størrelsen på countyene. Noen av countyene dekker stort område, men det bor få folk i dem. Dette gjelder spesielt i Midtvesten og de fleste heller rurale områdene i USA. Storbyene derimot, hvor de absolutt fleste bor (82 prosent), er arealmessig ganske små. Man kan derfor få inntrykket av at steder med stort areal er viktigere enn steder med lite areal, uavhengig av hvor mange som bor der.

La oss sammenligne stemmeresultatene fra to steder i USA.

Klikk for å komme til New York Times interaktive kart.
Garfield county i Montana. 12 554 kvadratkilometer, ifølge Wikipedia. Midt i mellom Rogaland og Buskerud i areal. 91 prosent av de stemmeberettigede innbyggerne stemte på Trump. Knallrødt. Garfield er så stort at du tydelig kan se det på kartet over hele USA.
Klikk for å komme til New York Times interaktive kart.












Klikk for å komme til New York Times interaktive kart.
Manhattan i New York klarer du ikke å skille ut på USA-kartet. 59,1 kvadratkilometer. Like stort som Trondheim tettsted. 9,7 prosent stemte Trump.

Garfield er stort og rødt, Manhattan er lite blått. Garfield virker viktigere. Og begge kartutsnittene har samme målestokk. Poenget er at de 91 prosentene i Garfield som stemte på Trump, er bare 653 personer. De 9,7 prosentene på Manhattan er 64 929 personer.

tirsdag 1. januar 2019

Fotballag og kommunestørrelse

Klikk for å se større.

Jeg hører på en hel haug av fotballpodcaster. En av dem er Toppfotball om norsk fotball. En gang sist høst hadde de en diskusjon om hvorfor man ikke har noe skikkelig bra fotballag fra Vestfold. Sandefjord gjorde for eksempel ikke stort annet sist sesong enn å vente på å rykke ned. En av hypotesene var at det er for mange jevnstore byer i fylket.

Dette fikk meg til å tenke, hvordan er sammenhengen mellom bybefolkning og toppnivå for klubber fra byen?

For enkelthetens skyld så jeg på kommunebefolkningen. Jeg er veldig fan av tettstedsstatistikken her til lands, men jeg var for lat til å skille ut tettstedsbefolkningen i tettstedet Oslo for den enkelte kommune. Tettstedet Oslo brer seg utover i nabokommunene. Lillestrøm er for eksempel en del av tettstedet Oslo. Med tanke på at det er såpass mange klubber i tettstedet Oslo, gikk jeg heller for kommunetallene.

Og er det noen sammenheng? Jeg vil si ja. Scatterplottet øverst i denne teksten viser alle kommuner i Norge med mer enn 2500 innbyggere. Røde kommuner hadde et eliteserielag i 2018-sesongen. Oransje kommuner hadde fotballag i høyst Obosligaen.

Bortimot alle kommuner med mer enn 40 000 innbyggere har klubb i Eliteserien. Unntakene er de seks følgende kommunene:

  • Fredrikstad
  • Asker
  • Larvik
  • Tønsberg
  • Arendal
  • Karmøy

To av seks unntak er altså Vestfold-lag. Med oppdaterte 2019-tall ville Sandefjord også føyd seg inn i rekken. Sandefjord kommune har forøvig over 60 000 innbyggere. Da er det naturlig at de som storebror i fylket har det største laget også. Hvis vi ser på de andre unntakene, så har Fredrikstad tradisjonelt sett hatt et eliteserielag. Karmøy har storebror Haugesund ikke altfor langt unna, samt Stavanger med Viking og Sandnes med Sandnes Ulf i samme region. Asker ligger nok for nærme Oslogryta. At et lag som Stabæk har fått det til istedenfor handler kanskje om spesifikke miljøer og personer, uten at jeg vet noe.

Det kan altså se ut til at alle unntakene, unntatt Fredrikstad, rett og slett er for nærme større kommuner og fotballag i samme region. Tønsberg og Larvik er litt i samme situasjon som Larvik.

Derfor la jeg til en ny variabel langsmed x-aksen i grafen, nemlig avstand fra midtpunktet i hver kommune til nærmeste kommune med mer enn 40 000 innbyggere. Hvorfor 40 000 innbyggere? Som nevnt, fordi det ser ut til at de aller fleste kommuner med såpass mange innbyggere har et lag i Eliteserien eller Obos-ligaen.

Det jeg syntes var mest interessant her, er at denne distansefaktoren et godt stykke på veien forklarer hvorfor relativt små kommuner i Møre og Romsdal (Molde og Kristiansund) og Sogn og Fjordane (Sogndal, Flora) har lag i toppseriene: De er regionsentre i landsdeler hvor det er langt til høyt befolkede kommuner. Ålesund er den eneste kommunen i Møre og Romsdal  og Sogn og Fjordane som har godt over 40 000 innbyggere.

[Lagt til 7. januar] Hvorfor har kommunestørrelse og avstand til andre storkommuner noe å si? Godt spørsmål. Rent økonomisk er det kanskje større sponsormarked i storbyene. Lettere å tiltrekke seg tilskuere og pengeinnteker? Rekrutteringen er kanskje lettere, men det er ikke mange lokale spillere på topplagene nå for tida. Kanskje kommunestørrelse, rekruttering og plass i "regionshierarkiet" tradisjonelt har hatt en viktig rolle, og at det vi ser nå er en slags stiavhengiget og konsekvens av at det har vært viktig før. Jeg bare spekulerer ...

lørdag 15. september 2018

Befolkningstetthet i Oslos delbydeler

 I en av de aller første innleggene på denne bloggen viste jeg et kart over befolkningen i Oslo fordelt i et rutnett. Jeg snakket også varmt om delbydeler som en fin inndelingsform som samsvarte godt med min oppfatning av de enkelte stedene.

Nå nylig fikk jeg en forespørsel om jeg kunne lage et kart som viste befolkningstettheten i disse delbydelene i. Vel så gjort. Kartet er interaktivt, så hvis du holder pekeren over den enkelte bydel vil du få opp både navn, total befolkning og befolkningstettheten per hektar for delbydelen.

Tallene gjelder for 1. januar 2018 og er hentet fra statistikkbanken til Oslo kommune.

Og nå må jeg snart se å få laget kart over noe annet enn bare Oslo.

onsdag 22. august 2018

Ungdomsidrett og sosial bakgrunn i Oslos bydeler

Innimellom tenker jeg at hvis jeg hadde blitt en politiker, så hadde min kampsak nummer én vært gratis barneidrett. Ikke bare er det gøy og artig med fysisk aktivitet, men det er viktig i et folkehelseperspektiv.

Da kan det være brutalt å tenke på hva treningsutstyr, lisenser og utgifter kan koste, spesielt for familier som ikke har altfor god råd.

Derfor leste denne artikkelen fra NRK, om at klubben Brodd har kuttet ut årskontingent for de yngste, med stor interesse.

I tillegg synes jeg at fotballbladet Josimar har hatt noen interessante reportasjer om ulikhetene i fotballtilbud og -muligheter på østkant og vestkant i Oslo.

Og siden jeg holder på å lære meg R og pakken ggplot2 for datavisualisering, hvorfor ikke lage en graf om ungdoms deltakelse i organisert friidrett?
Klikk for å se større. Sånn faktisk.


Hvis du klikker på grafen, slik at den blir større, så viser den hvor mange prosent av ungdommen med henholdsvis lav middels og høy sosial bakgrunn i hver bydel som deltar i organisert idrett.

Bydelene er sortert fra venstre til høyre etter andelen ungdom (ungdomsskole-elever og videregående skole-elever) med lav sosial bakgrunn som deltar i organisert idrett.

De stiplete linjene viser gjennomsnittet i Oslo for ungdom med de forskjellige bakgrunnene.

Tallene er hentet fra rapporten Ung i Oslo 2015, skrevet av Patrick Lie Andersen og Anders Bakken, via Oslo statistikkbank.

Hva menes egentlig med sosial bakgrunn? "I undersøkelsen er dette målt gjennom et samlemål for familiens sosioøkonomiske ressurser (definert som «summen» av foreldrenes utdanningsnivå, bøker i hjemmet, om man drar på ferie, har eget soverom, om man har bil etc.)." (Andersen og Bakken 2015, side 4)

Ikke overraskende, så er trenden at ungdom på Østkanten i gjennomsnitt deltar mindre i organisert idrett enn de på Vestkanten (Nordstrand inkludert). Dette gjelder uansett hvilken sosial bakgrunn ungdommene har.

Det er det grove, overordnete bildet, så er det selvfølgelig variasjon og detaljer som viker litt fra denne historien. For eksempel er idrettsdeltakelsen blant ungdom med høy bakgrunn i Stovner markant høyere enn i de andre bydelene i Groruddalen. Bare Vestre Aker har høyere idrettsdeltakelse blant de med høy sosial bakgrunn enn Østensjø. Nå er Østensjø en bydel med særskilt sterke idrettstradisjoner- og miljøer.

Her kan jeg også legge til at dette datamaterialet er basert på en spørreundersøkelse med et utvalg. Jeg har ikke tittet nøye nok på rapporten til å se om jeg kan beregne og vise konfidensintervall. Eller for å si det på denne måten: Det kan hende at de forskjellene vi ser her blant de som svarte på undersøkelsen ikke finnes hvis vi skal snakke om alle ungdommene i bydelene.

Frogner er et markant unntak blant bydelene i vest. Jeg kan bare spekulere i at det er fordi Frogner er en relativt "bypreget" bydel med ikke altfor mange idrettsmuligheter uten å måtte reise et stykke.

Det som jeg synes er mest interessant av alt i denne figuren, er det som skjer med ungdom med lav sosial bakgrunn i bydelene på Vestkanten, altså Ullern, Nordstrand, Vestre Aker og spesielt Nordre Aker.

Når man anekdotisk kan snakke om at ungdommen på Vestkanten er mer aktive i idrett enn de på Østkanten, så kunne man spekulere i at det er fordi ungdom på Vestkanten generelt er mer velstående og har økonomisk mulighet og oppfølging i hjemmet til å satse 110 prosent på å bli den nye Petter Northug eller Martin Ødegård.

Derfor er det interessant å se at idrettsdeltakelsen i disse vestkant-bydelene er markant høyere også blant ungdom med lav sosial bakgrunn.

I mine studier på samfunnsgeografi hadde vi en del om nabolagseffekter, altså at nabolaget du bor i har noe å si for dine livsmuligheter, uavhengig av hvilke gener du har eller hvor mange bøker foreldrene dine har i hylla. Altså, hva har det å si å vokse opp i et nabolag med høy velstand kontra lav velstand. Har det noe å si å vokse opp i et område med kommunalboliger?

Noe som man har sett i studier i USA (linken går til en artikkel jeg hadde på pensum av George Galster, hvor dette er omtalt), er at barn i mindre velstående familier kan prestere litt bedre hvis de bor i områder med litt mer velstående familier. Man kan da snakke om en peer-effekt: At du påvirkes av de du ser på som dine "likemenn", altså de du går i klasse med.

Min antakelse er at en slik effekt kan være med på å forklare idrettsdeltakelsen til ungdom med lav sosial bakgrunn på Vestkanten.

Under the hood

Og over til noe helt annet. Fikk du med deg at jeg lagde den grafen i R? Den viktigste motivasjonen for å lage denne grafen var jo at jeg holder på å lære meg å bruke R, og da blant annet datavisualiseringspakken ggplot2. Hvis du er nysgjerrig på hvordan jeg lagde den, så har du koden min her.

Dette er aller første gang jeg lager min helt egen graf i R, så koden er nok helt håpløs. Transformeringene og databehandlingen for å klargjøre tallene for grafen kan nok skrives mye mer effektivt, med hjelp av litt pipes. Jeg fikk god hjelp av googling og denne boka her, R for Data Science, som er åpen og gratis på internett. Den holder deg trygt i hånda når du er helt newbie. Anbefales!

fredag 3. august 2018

Hvor bør knutepunktutviklingen komme (og slik lager du et bivariat punktkart)

Klikk for å se større.
Jeg hadde lyst til å gjøre to ting. Jeg ville lage et bivariat punktkart, og jeg ville jobbe litt med datasettene til Entur om kollektivtransport (som jeg skal bruke massevis i doktorgraden min).

Kartet du ser her er punktdata over tog- og t-banestasjoner i Oslo-området. I tillegg til lokaliseringen, så viser punktene to ting – derav bivariat – hvor lang tid det tar å reise fra den stasjonen til Oslo sentrum, og tettheten av beboere og arbeidsplasser i nærområdet.

Det som egentlig er ekstra kult med punkter, er at du strengt tatt kan vise tre forskjellige verdier samtidig, altså lage trivariate kart. Du kan gjøre som i kartet over, vise en ting (tetthet) med fargen til omrisset og vise en annen ting med fyllfargen (reisetid). I tillegg kan du variere størrelsen på punktene for å vise en tredje verdi, gjerne en absolutt verdi, som antall avganger, f.eks. Tetthet, hvor du deler befolkning på areal, er en relativ verdi og det motsatte av absolutt.

Punktene i kartet er egentlig to kartlag.
Det jeg gjorde for å få til det, var å legge to lag oppå hverandre i QGIS (se til venstre). Jeg sørget for at det nederste punktlaget hadde litt større punkter (density = punktstørrelse 3 i dette tilfellet) enn det øverste laget (transit time = punktstørrelse 2). Ingen av punktene har omrisslinje, og det nederste laget fungerer som omriss for det øverste.

Det ser ikke sånn ut på kartet, men jeg velger en gråskala fra svart til hvit for det øverste laget. Grunnen til det kommer jeg straks tilbake til.




Klikk for å se større. Blendingsmoduser skaper magi.
Deretter går jeg inn i symbologiinnstillingene til det øverste laget med gråskala (se bildet til venstre), transit time-laget, finner fram til nedtrekksmenyen for blendingsmodus, og velger multipliser.

Det som skjer er at tallverdiene til fargene i det øverste laget blir multiplisert med fargene i laget under der de overlapper. Er det kort til sentrum (svart) i et tett befolket område (turkis), da ganges svart med turkis. Langt til sentrum i grisgrend strøk? Hvitt ganges med brunt.

Hvorfor nevnte jeg QGIS spesifikt? På grunn av transparency blending modes. Hvis du er godt bevandret i Photoshop, så kjenner du antakeligvis godt til blendingsmoduser. Poenget er at hvis du vil ha noe delvis gjennomsiktig, så er ikke gjennomsiktig bare gjennomsiktig. Man kan for eksempel velge om fargemetningen i det øverste laget skal beholdes, men at lysstyrken skal preges av det underliggende laget. QGIS har totalt tolv forskjellige blendingsmoduser. ArcGIS, som jeg bruker mye ellers, har bare én.

Du har kanskje prøvd å legge et lag med fjellskygge over et kartlag med farger for arealbruk (fjell, hav, jordbruk, skog) og synes at det blir litt matt, kjedelig og dødt? Neste gang prøv ut forskjellige blendingsmoduser. Multipliser er en god gjenganger.

Her er en fantastisk blogg om fantasikart (!) med en veldig fin gjennomgang av forskjellige blendingsmoduser i Photoshop.

Når jeg først nevner programvare, så brukte jeg nettverksanalyse i ArcGIS til å beregne reisetiden med kollektivtransport til Oslo sentrum. Network Analyst-tilleggspakken til ArcGIS klarer ikke å beregne kollektivreiser på egenhånd.

Melinda Morang har imidlertid vært i førersetet for en fantastisk verktøypakke, Using GTFS Data in ArcGIS, som man kan laste ned og bruke til å kjøre nettverksanalyser med kollektivtransport.

En klar svakhet i det datamaterialet som blir framstilt her. Er at det viser reisetider fra akkurat klokka 08.00. Hvis det ikke går noe tog til Oslo før 08.05 fra en stasjon, så er ventetiden med i reisetiden på kartet. For å være skikkelig robust burde reisetidene gjennom en hel time (avreise 08.00, 08.01, 08.02 osv) blitt beregnet før den korteste reisetiden ble brukt i framstillingen.

450 meter buffer rundt hver stasjon, summerer opp areal, befolkning og
arbeidsplasser fra 250 x 250 rutenett fra SSB.
Datakilder: SSB, Entur, Bing Aerial
Når vi kommer til kvaliteten på datamaterialet kan jeg også nevne at arealet som brukes i tetthetsberegningene godt kunne vært hakket mer rafinert. Jeg lagde buffere med 450 meter radius rundt hver stasjon, og summerte antall beboere, arbeidsplasser og det totale arealet i alle cellene (i et rutenett fra SSB) som bufferen overlappet med (se til venstre). Vannareal er altså med i beregningen. Tettheten i rutenettet er forøvrig med i bakgrunnen i det endelige kartet.

Hvorfor buffere med akkurat 450 meter radius? Det er ganske vanlig å operere med at folk er villig til å gå 400 meter for å ta kollektivtransport. Størrelsen på cellene i rutenettet, på 250 x 250m, blir akkurat for små til at det er godt nok med bare en celle som "nærområde" for stasjonen. Derfor sørget jeg for å ha med de områdene som i hvert fall er innenfor 500 meter fra stasjonen.