Suomalaiset uutismediat ja tekoälybotit: ketkä estävät ChatGPT:n ja muut tekoälyt?

Lari Numminen
Kirjoittanut Lari Numminen
4 min lukuaika
7.10.2026 23.52.58

Generate More on helsinkiläinen AEO- ja AI SEO -toimisto pohjoismaisille ja kansainvälisille B2B-ohjelmistoyrityksille. Sen perusti vuonna 2024 Lari Numminen. Seuraamme tässä tutkimuksessa, miten suomalaiset uutismediat suhtautuvat tekoälyyhtiöiden botteihin. Ensimmäinen mittaus tehtiin helmikuussa 2024, toinen lokakuussa 2026, ja jatkamme samalla menetelmällä vuonna 2027.

Tärkeimmät havainnot

Kävimme lokakuussa 2026 uudelleen läpi samat 99 suomalaista uutissivustoa kuin helmikuussa 2024. Niistä 89 on yhä verkossa omalla osoitteellaan, joten vertailu tehtiin näiden kesken.

Mittari (89 vertailukelpoista mediaa) Helmikuu 2024 Lokakuu 2026
Estää vähintään yhden vuonna 2024 seuratuista kahdeksasta botista 55 (62 %) 82 (92 %)
Estää OpenAI:n hakubotin (OAI-SearchBot) ei mitattu 62 (70 %)
Estää vähintään yhden tekoälyhaun botin (OAI-SearchBot, PerplexityBot tai Claude-SearchBot) ei mitattu 63 (71 %)
Estää koulutusbotit mutta jättää hakubotit auki ei mitattu 19
Ei estä yhtään tekoälybottia 34 7
Estää Googlebotin tai Bingbotin 0 0

Kolme asiaa nousee esiin. Ensinnäkin tekoälybottien estäminen on muuttunut poikkeuksesta normiksi: vain seitsemän mediaa jättää kaikki tekoälybotit vapaasti liikkeelle. Toiseksi suurin osa medioista estää nykyään myös botit, joiden avulla ChatGPT, Perplexity ja Claude hakevat lähteitä vastauksiinsa. Kolmanneksi kustantajat ovat jakautuneet kahteen linjaan, ja linja kulkee usein konsernin mukaan.

finnish-news-media-ai-bots-2026-fi

Koulutusbotti vai hakubotti: miksi ero on tärkeä

Vuonna 2024 kysymys oli yksinkertaisempi. Uutismediat päättivät lähinnä siitä, saako niiden sisältöä käyttää tekoälymallien koulutukseen. Nyt tekoälyyhtiöillä on erilliset botit koulutukselle ja haulle, ja estämisellä on kaksi eri seurausta.

OpenAI kertoo bottiensa ohjeissa, että GPTBotin estäminen tarkoittaa, ettei sivuston sisältöä käytetä mallien koulutukseen. Saman ohjeen mukaan sivustot, jotka estävät OAI-SearchBotin, eivät näy ChatGPT:n hakuvastauksissa. Anthropicin ohjeiden mukaan ClaudeBot kerää aineistoa koulutukseen, kun taas Claude-SearchBotin estäminen voi heikentää sivuston näkyvyyttä hakutuloksissa. Perplexity puolestaan sanoo dokumentaatiossaan, että PerplexityBot nostaa sivustoja hakutuloksiin eikä sitä käytetä tekoälymallien koulutukseen.

Googlella tilanne on toinen. Google-Extended määrää, saako sisältöä käyttää Gemini-mallien koulutukseen ja vastausten pohjana Gemini-sovelluksissa. Googlen ohjeen mukaan se ei vaikuta sivuston näkymiseen Google-haussa. Siksi yksikään tutkituista medioista ei ole menettänyt näkyvyyttään Googlessa, vaikka 82 niistä estää Google-Extendedin.

what-is-an-ai-bot-how-to-block-fi

Kaksi linjaa: kaikki kiinni tai vain koulutus kiinni

Suurin osa medioista on sulkenut sekä koulutus- että hakubotit. Keskisuomalaisen kaikki 29 tutkittua lehteä estävät myös OpenAI:n ja Perplexityn hakubotit. Alma Median sivustot, Helsingin Sanomat, Ilta-Sanomat, Aamulehti, Turun Sanomat ja Hufvudstadsbladet menevät vielä pidemmälle ja estävät lisäksi Clauden hakubotin. Näiden medioiden juttuja ei siis pitäisi näkyä ChatGPT:n hakuvastausten lähteinä.

Toinen ryhmä estää vain koulutuksen. Siihen kuuluvat Yle, Kalevan lehdet, Ilkka-Pohjalainen ja sen paikallislehdet, A-lehtien Apu ja Eeva, Maaseudun Tulevaisuus, Koneviesti sekä aikakauslehdet ET-lehti, Gloria ja Kodin Kuvalehti. A-lehdet on tehnyt valinnan näkyvimmin: sen robots.txt nimeää erikseen OpenAI:n, Clauden ja Perplexityn haku- ja käyttäjäbotit ja sulkee niiltä vain muutaman hakemiston, kun koulutusbotit on estetty kokonaan.

Kuka muutti linjaansa

Helmikuussa 2024 tutkimuksen 89 mediasta 34 ei estänyt yhtään tekoälybottia. Nyt niistä 27 estää. Muutos koskee kokonaisia konserneja: Kalevan kaikki seitsemän lehteä, Turun Sanomien paikallislehdet, neljä Otavan aikakauslehteä, neljä Hilla Groupin lehteä, HSS Median ruotsinkieliset lehdet ja Viestimedian lehdet ovat siirtyneet estämään.

Näkyvin yksittäinen muutos on Yle. Vuonna 2024 Ylen robots.txt ei sisältänyt ohjeita tekoälyboteille. Nyt se estää koko sivuston 38 nimetyltä botilta, muun muassa GPTBotilta, ChatGPT-Userilta, ClaudeBotilta ja Google-Extendediltä. OpenAI:n, Perplexityn ja Clauden hakubotteja Ylen tiedosto ei nimeä, joten niihin pätevät samat yleiset säännöt kuin muihin hakukoneisiin.

Yksikään vuonna 2024 bottia estänyt media ei ole poistanut estojaan.

Kuka ei estä mitään

Seitsemän mediaa ei estä yhtään tekoälybottia: Ålandstidningen, Åbo Underrättelser, Pietarsaaren Sanomat, Kansan Uutiset, Hymy, MTV Uutiset ja Nya Åland. Ruotsinkielisistä medioista viisi kahdeksasta estää nyt koulutusbotit, kun vuonna 2024 niitä oli kolme.

Botit yksitellen

Taulukko näyttää, kuinka moni 89 mediasta estää kunkin botin pääsyn etusivulleen lokakuussa 2026.

Botti Yhtiö ja käyttötarkoitus Estää
GPTBot OpenAI, koulutus 82
Google-Extended Google, Gemini-koulutus 82
CCBot Common Crawl, avoin verkkoaineisto 82
ChatGPT-User OpenAI, käyttäjän pyytämät haut 78
ClaudeBot Anthropic, koulutus 67
PerplexityBot Perplexity, haku 63
OAI-SearchBot OpenAI, ChatGPT-haku 62
Applebot-Extended Apple, koulutus 33
Claude-SearchBot Anthropic, haku 28
Googlebot ja Bingbot Google- ja Bing-haku 0

Uudemmat botit, kuten Claude-SearchBot ja Applebot-Extended, puuttuvat vielä monesta tiedostosta. Ero kertoo, että moni media päivittää listaansa harvoin ja että estolistan kattavuus riippuu siitä, milloin se on viimeksi käyty läpi.

Mitä tämä tarkoittaa yrityksille

Kun ChatGPT tai Perplexity vastaa kysymykseen suomalaisesta yrityksestä tai toimialasta, se ei voi käyttää lähteenä mediaa, joka on estänyt sen hakubotin. Seitsemän kymmenestä tutkitusta uutismediasta on tehnyt niin. Vastauksen lähteiksi jää silloin muuta sisältöä.

Yritykselle tämä voi olla mahdollisuus. Kun moni uutismedia puuttuu tekoälyhaun lähteistä, yrityksen omalla sivustolla oleva selkeä ja ajantasainen tieto on useammin tarjolla vastauksen pohjaksi. Kerroin aiemmin, miten ChatGPT:ssä saa näkyvyyttä.

Menetelmä

Otos. Samat 99 suomalaista uutis- ja aikakausmediaa kuin helmikuun 2024 tutkimuksessa. Konserniryhmittely on vuoden 2024 tutkimuksesta.

Aineisto. Jokaisen sivuston julkinen robots.txt-tiedosto ladattiin 7. lokakuuta 2026. Tiedostot luettiin Pythonin vakiokirjaston robots.txt-jäsentimellä, joka kertoo, saako kukin botti hakea sivuston etusivun.

Vertailu. Vuoden 2024 vertailuluku käyttää samoja kahdeksaa bottia kuin vuonna 2024: CCBot, ChatGPT-User, GPTBot, Google-Extended, Omgilibot, FacebookBot, Amazonbot ja anthropic-ai. Vuoden 2024 artikkelissa estävien osuus oli 58 % kaikista sadasta mediasta. Tässä vertailussa mukana ovat vain ne 89 mediaa, jotka ovat yhä verkossa, ja niistä 62 % esti botteja vuonna 2024.

Pois jätetyt. Kymmenen sivustoa jäi pois. Neljä on sulautunut toiseen lehteen tai ohjaa sen sivuille, viisi ei enää vastaa, ja vaasa.fi on nykyään Vaasan kaupungin sivusto.

Rajoitukset. Robots.txt on pyyntö, ei tekninen esto. Palomuurien tai sisällönjakeluverkkojen bottiestoja tutkimus ei mittaa. Perplexityn mukaan sen käyttäjäbotti ei yleensä noudata robots.txt-sääntöjä.

Päivitysloki

  • Helmikuu 2024: ensimmäinen mittaus, 100 mediaa ja kahdeksan bottia.
  • Lokakuu 2026: toinen mittaus, 89 vertailukelpoista mediaa ja 19 bottia, mukana tekoälyhaun botit.
  • Seuraava mittaus: vuonna 2027.

Usein kysytyt kysymykset

Uutismediat ja tekoälybotit: UKK

Kuinka moni suomalainen uutismedia estää tekoälybotit?

Lokakuussa 2026 tutkituista 89 mediasta 82 (92 %) esti vähintään yhden tekoälyn koulutusbotin. Helmikuussa 2024 osuus oli 62 %.

Näkyvätkö suomalaiset uutismediat ChatGPT:n vastauksissa?

Suurin osa ei. 62 mediaa 89:stä estää OpenAI:n hakubotin, ja OpenAI:n mukaan tällaiset sivustot eivät näy ChatGPT:n hakuvastauksissa.

Estävätkö uutismediat Googlen?

Eivät. Yksikään media ei estä Googlebotia tai Bingbotia. Google-Extendedin estäminen ei Googlen mukaan vaikuta näkyvyyteen Google-haussa.

Mitä eroa on koulutusbotilla ja hakubotilla?

Koulutusbotti kerää aineistoa tekoälymallien koulutukseen. Hakubotti hakee sivuja, joita tekoälypalvelu käyttää ja linkittää lähteinä vastauksissaan.

Miten tekoälybotin voi estää?

Lisää sivuston juuressa olevaan robots.txt-tiedostoon botin nimi User-agent-riville ja sen alle Disallow: /. Robots.txt on pyyntö, eikä kaikki botit noudata sitä.

Saako lukuja käyttää?

Kyllä, kun lähteeksi linkitetään tämä sivu.