Maksaako kehitystiimisi yhä liikaa suljettujen tekoälykoodausrajapintojen käytöstä?

Raha, suvereniteetti, vaatimustenmukaisuus, energia ja nopeus — ero on kaventunut nopeammin kuin useimmat tiimit ymmärtävät.

Tekoälykoodauksen infrastruktuuria käsittelevän artikkelisarjamme osa 1/4. Päivitetty 29. heinäkuuta 2026.

Useimmat pohjoismaiset ohjelmistokehitystiimit ottivat tekoälyavusteiset koodaustyökalut käyttöön samalla tavalla: joku hankki Claude- tai ChatGPT-tilauksen, se toimi hyvin, tiimi sai API-pääsyn, ja nyt kyseessä on kulurivi, jota kukaan ei enää kyseenalaista. API-laskut kasvavat, koodi poistuu Suomesta jokaisen pyynnön yhteydessä, eikä kukaan ole tarkistanut, onko alun perin valittu malli edelleen oikea kyseiseen tehtävään.

Me teimme analyysin. Tulokset yllättivät meidät — ja todennäköisesti ne yllättävät myös sinut.

Viisi asiaa, jotka kannattaa arvioida uudelleen

Raha

Halvimman ja kalleimman tavan välillä suorittaa tekoälyavusteisia koodaustehtäviä on nyt noin 200-kertainen hintaero. Claude Fable 5:n tuottamat miljoona tokenia maksavat 50 dollaria. DeepSeek V4 Flash maksaa 0,28 dollaria. GLM-5.2 — avoimilla painoilla julkaistu malli, joka saa toimialan vakiintuneessa SWE-bench Pro -koodausvertailussa GPT-5.5:tä paremman tuloksen — toimii murto-osalla suljettujen mallien hinnasta. MiniMax M3 puolestaan yltää samassa vertailussa GPT-5.5:n tasolle ja maksaa 0,54 dollaria edustavaa tehtävää kohden. Se on 37 kertaa halvempi kuin suljettu huippumalli, vaikka suorituskyky vastaa sitä tai ylittää sen valtaosassa koodaustehtäviä.

Jos viiden kehittäjän tiimisi tuottaa Claude Sonnet 5:llä 100 miljoonaa tulostokenia kuukaudessa, mikä on agenttisissa koodaustyönkuluissa tavallinen määrä, kustannukset ovat noin 1 000–1 500 dollaria kuukaudessa riippuen siitä, onko aloitushinnoittelu edelleen voimassa. Sama työmäärä itse ylläpidetyllä avoimilla painoilla julkaistulla mallilla UpCloudin H100-palvelimella Helsingissä, vain työajalle ajastettuna, maksaa 388 euroa kuukaudessa. Säästö on Sonnet 5:n normaalihinnoittelulla noin 70 prosenttia, aloitushinnoittelun aikana hieman vähemmän, ja laatuero tavallisissa koodaustehtävissä on pienempi kuin useimmat tiimit olettavat.

Suvereniteetti

Jokainen OpenAI:lle, Anthropicille tai Googlelle tehty API-kutsu lähettää koodisi — immateriaalioikeutesi, liiketoimintalogiikkasi ja testiaineistoihin upotetut asiakastietosi — Yhdysvalloissa sijaitseville palvelimille. GDPR:n piiriin kuuluville suomalaisyrityksille, julkishallinnon organisaatioille ja säännellyillä toimialoilla toimiville kyseessä on vaatimustenmukaisuuskysymys, jonka moni tiimi on hiljaisesti lykännyt ratkaisemisen sijaan. Kyse ei myöskään ole hypoteettisesta riskistä: kesäkuussa 2026 Claude Fable 5:n käyttö keskeytettiin maailmanlaajuisesti lähes kolmeksi viikoksi Yhdysvaltojen vientivalvontamääräyksen vuoksi. Sen varaan rakennetut työnkulut pysähtyivät ilman, että tiimeillä oli asiaan mitään vaikutusvaltaa.

Suomalaisessa infrastruktuurissa toimivat avoimilla painoilla julkaistut mallit poistavat tämän riippuvuuden. Koodi ei koskaan poistu maasta. Mallin painot ovat auditoitavissasi. Kolmannen osapuolen henkilötietojen käsittelysopimusta ei tarvita.

Vaatimustenmukaisuus

EU:n sääntelykehitys tekee suvereniteettikysymyksestä konkreettisen ja liittää siihen määräajat.

EU:n tekoälysäädös. Tekoälysäädöstä alettiin soveltaa yleisesti 2. elokuuta 2026. Vaativinta tasoa eli suuririskisiä tekoälyjärjestelmiä koskevia velvoitteita lykättiin kesäkuussa 2026 virallisesti hyväksytyllä "AI Omnibus" -yksinkertaistamispaketilla: herkillä aloilla käytettävien suuririskisten järjestelmien velvoitteita sovelletaan 2. joulukuuta 2027 alkaen ja säänneltyihin tuotteisiin sisältyvää tekoälyä koskevia velvoitteita 2. elokuuta 2028 alkaen. Lykkäys antaa lisäaikaa, mutta se ei muuta vaatimusten sisältöä: suuririskiset käyttöönotot edellyttävät teknistä dokumentaatiota, läpinäkyvyyttä ja ihmisen valvontaa. Omassa hallinnassasi olevassa infrastruktuurissa toimivat auditoitavat avoimilla painoilla julkaistut mallit helpottavat näiden dokumentointi- ja auditointivaatimusten täyttämistä olennaisesti verrattuna mustan laatikon rajapintoihin, joiden toiminta ja saatavuus voivat muuttua ilman ennakkoilmoitusta.

DORA. Digitaalista häiriönsietokykyä koskevaa DORA-asetusta on sovellettu EU:n finanssialan toimijoihin tammikuusta 2025 lähtien. Jos tekoälyavusteiset koodaustyökalut tukevat kriittisiä tai tärkeitä toimintoja, ne kuuluvat DORA:n tieto- ja viestintäteknisten kolmansien osapuolten riskienhallintavaatimusten piiriin. Tämä tarkoittaa irtautumisstrategioita, korvattavuuden arviointia ja keskittymäriskin analysointia. Kehitystyönkulku, joka on täysin riippuvainen yhdestä yhdysvaltalaisesta API-toimittajasta, on juuri sellaista keskittymistä, jota DORA velvoittaa finanssialan yritykset tarkastelemaan. Itse ylläpidetty kyvykkyys avoimilla painoilla julkaistuilla malleilla on uskottava irtautumisstrategia. "Vaihtaisimme toimittajaa" on heikompi sellainen.

CSRD ja ESRS E1. Yritysten kestävyysraportointidirektiivin piiriin kuuluvilla yrityksillä ESRS E1 kattaa Scope 3 -päästöt, joihin sisältyvät ostetut pilvi- ja tekoälypalvelut. Käytännön ongelma on se, että useimmat suljettujen API-palvelujen tarjoajat eivät julkaise työkuormakohtaisia päästötietoja, joten tekoälyn käytön Scope 3 -laskenta perustuu parhaimmillaankin arvioihin. Itse ylläpidetty inferenssi infrastruktuurissa, jonka energiankulutuksesta ja hukkalämmön hyödyntämisestä julkaistaan tiedot, tuottaa lukuja, joiden takana voit aidosti seistä kestävyysraportissa.

Tämä ei tarkoita, että suljetut rajapinnat olisivat vaatimustenvastaisia. Asia riippuu toimialastasi, käyttötapauksestasi ja sopimuksistasi. API-lähtöisen toimintamallin vaatimustenmukaisuuskustannukset kuitenkin kasvavat, ja vaihtoehtoja on määräaikojen lähestyessä niillä tiimeillä, jotka arvioivat tilanteen nyt.

Energia

Kaikki laskenta ei ole samanarvoista. UpCloudin Helsingin-datakeskus toimii sataprosenttisesti uusiutuvalla energialla ja siirtää jopa 90 prosenttia GPU-palvelinten hukkalämmöstä kaupungin kaukolämpöverkkoon. Yhdysvaltalaisessa datakeskuksessa tehtävän suljetun API-kutsun hiilijalanjälkeä et pysty mittaamaan tai hallitsemaan. Helsingissä itse ylläpidetty inferenssikutsu kuuluu ympäristövaikutuksiltaan maailman pienimpiin vaihtoehtoihin. ESG-sitoumuksia tehneille yrityksille kyse ei ole pyöristysvirheestä. Vaikutus on auditoitavissa, ja kuten edellä käsitelty CSRD osoittaa, auditointikelpoisuudesta on tulossa vaatimus.

Nopeus

Suljetut huippumallit ovat hitaita. Claude Fable 5 tuottaa noin 28 tokenia sekunnissa. Yksittäiseen kysymykseen tämä riittää hyvin. Agenttisessa koodaussilmukassa, joka tekee 20–50 API-kutsua tehtävää kohden, viive kuitenkin kertautuu nopeasti: kymmenen vaiheen ketju, jossa jokainen vaihe kestää kaksi sekuntia, lisää jokaiseen tehtävään 20 sekuntia odotusta, ja agenttisessiot suorittavat päivittäin kymmeniä tehtäviä.

Erikoistuneella laitteistolla toimivat avoimilla painoilla julkaistut mallit voivat olla 100 kertaa nopeampia. Cerebras tarjoaa malleja jopa 3 000 tokenin sekuntinopeudella. Jopa yhdellä H100-kortilla vLLM:n kautta ajettava itse ylläpidetty 70B-malli tuottaa 250–300 tokenia sekunnissa, eli noin kymmenen kertaa enemmän kuin suljetut huippumallit.

Ero on kaventunut

Vielä kaksitoista kuukautta sitten suljettujen rajapintojen puolesta oli yksinkertainen argumentti: ne olivat koodauksessa selvästi parempia. Tämä ei enää pidä yleisesti paikkaansa.

Kolme avoimilla painoilla julkaistua mallia — GLM-5.2 tuloksella 62,1 %, MiniMax M3 tuloksella 59,0 % ja Kimi K2.6 tuloksella 58,6 % — yltävät nyt GPT-5.5:n 58,6 prosentin tulokseen tai sen yli SWE-bench Prossa, joka on todellisiin ohjelmistokehitystehtäviin perustuva ja aineiston vuotamista torjuva vertailu. Luvut ovat toimittajien raportoimia, ja eri testausympäristöjen välisiä vertailuja tulee pitää suuntaa antavina. Ja avointen mallien kärki liikkuu edelleen: Moonshot julkaisi Kimi K3:n, tähän mennessä suurimman avoimen mallin, täydet mallipainot heinäkuun 2026 lopussa — malli sijoittuu riippumattomassa Vals AI:n SWE-bench Verified -vertailussa kolmanneksi (93,4 %), heti GPT-5.6 Solin ja Claude Fable 5:n jälkeen.

Claude Fable 5 johtaa edelleen SWE-bench Prota 80,3 prosentin tuloksella. Anthropicin 24. heinäkuuta julkaisema uusi Claude Opus 5 seuraa aivan sen perässä 79,2 prosentin tuloksella ja puolella hinnalla. Tämä huipputason suorituskyky maksaa kuitenkin tehtävää kohden 37 kertaa enemmän kuin parhaat avoimet mallit, ja sitä tarvitaan vain vaikeimmassa 20 prosentissa koodaustyöstä. Tavanomaisessa 80 prosentissa — koodikatselmoinneissa, testien tuottamisessa, refaktoroinnissa, dokumentoinnissa ja virheenkorjauksessa — avoimilla painoilla julkaistut mallit ovat jo kilpailukykyisiä. Ratkaisu perustuu periaatteeseen, jota sovellamme kaikessa tekoälytyössämme: oikea malli oikeaan tehtävään.

Mitä artikkelisarja käsittelee

Analysoimme koko kentän: yli 20 mallia, kaikki merkittävät API-palveluntarjoajat, erikoistuneet inferenssilaitteistot ja itse ylläpidettyjen ratkaisujen talouden suomalaisessa infrastruktuurissa. Tuloksena on neliosainen artikkelisarja.

Osa 2: Token-taloustiede. Kattava vertailu suljettujen ja avoimilla painoilla julkaistujen mallien hinnasta, suorituskyvystä ja nopeudesta sekä hankintapäätöksiin tarvittavat tietotaulukot.

Osa 3: Avoimilla painoilla julkaistut mallit koodauksessa — todellinen vertailukuva. Mitkä avoimet mallit toimivat eri ohjelmistokehitystehtävissä IDE:n automaattisesta täydennyksestä itsenäisiin koodausagentteihin sekä millaista laitteistoa niiden itse ylläpitäminen vaatii.

Osa 4: Itse ylläpitäminen suomalaisessa GPU-infrastruktuurissa. UpCloudin Helsingin-ratkaisun talous, mukaan lukien työajalle tehtävä ajastusoptimointi, joka laskee H100-palvelimen hinnan 388 euroon kuukaudessa, kannattavuusrajat sekä päätösmalli sen arvioimiseen, milloin itse ylläpitäminen voittaa API-palvelut.

Tiedot ovat ajan tasalla 29. heinäkuuta 2026. Markkinassa, jossa Anthropic, OpenAI ja Moonshot ovat kaikki julkaisseet uuden lippulaivamallin viimeisen kuukauden aikana, tällä on merkitystä.