Den mest kapabla modellen är inte alltid den rätta. Det låter som en självklarhet, men i praktiken väljer de flesta företag AI-modell som man väljer tv: största skärmen som budgeten tillåter. Under 2025 och 2026 har motrörelsen tagit fart, och den kommer inte från sparsamma inköpschefer utan från tekniksidan själv.
Mest citerat är ett forskningspapper från NVIDIA sommaren 2025 med den talande titeln Small Language Models are the Future of Agentic AI: för merparten av anropen i agentsystem, där uppgifterna är repetitiva och väldefinierade, är små modeller tillräckligt kapabla, mer lämpade och väsentligt billigare, och det rationella är heterogena system där små modeller gör grovjobbet och stora kopplas in vid behov. När företaget som säljer beräkningskraften argumenterar för mindre modeller är det värt att lyssna.
Små språkmodeller, ofta kallade SLM, är modeller som är tillräckligt kompakta för att köras på egen eller enklare hyrd hårdvara, tränade eller anpassade för avgränsade uppgifter snarare än allmän briljans.
Lokal drift är det närliggande begreppet: att modellen körs i er miljö, på egen server, i eget moln eller hos en svensk driftleverantör, i stället för via anrop till en global tjänst.
Varför pratar alla om det här nu?
Tre kurvor har korsats. Den första är kapabilitet: dagens små modeller presterar på nivåer som toppmodeller låg på för bara något år sedan, och för avgränsade uppgifter, klassificering, extraktion, sammanfattning inom ett känt område, är gapet mot de största modellerna ofta försumbart.
Den andra är kostnad. Stanfords AI Index-rapport 2025 noterar att priset för att köra en modell på en given prestandanivå föll mer än 280 gånger på 18 månader, och att inferenspriser beroende på uppgift faller mellan 9 och 900 gånger per år. Sådana kurvor förändrar kalkyler i grunden: det som krävde en av de största modellerna 2024 ryms i en liten modell i dag.
Den tredje är suveränitet. Med frågorna om var företagsdata hamnar har lokal drift gått från entusiastprojekt till styrelseargument, och en svensk infrastruktur har vuxit fram: Berget AI, som kör öppna modeller på servrar i Sverige utan att data lämnar landet, tog in drygt 20 miljoner kronor i början av 2026 med hänvisning till just den efterfrågan.
En liten språkmodell räcker när uppgiften är avgränsad och volymen hög: klassificera, extrahera, sammanfatta inom ett känt område. Den räcker inte när uppgiften kräver bred kunskap eller sammansatta resonemang.
När räcker en liten modell, konkret?
Testa uppgiften mot tre kriterier, för alla tre behöver vara uppfyllda.
Avgränsad uppgift. Sortera inkommande ärenden i tolv kategorier. Plocka belopp, datum och referenser ur fakturor. Sammanfatta rapporter enligt en fast mall. Uppgifter med facit, där rätt svar går att definiera. Här kan en liten modell, ofta anpassad mot era exempel, prestera i klass med de största.
Hög volym. Vid tiotusentals anrop per månad blir skillnaden mellan att betala per anrop och att äga driften verklig ekonomi. Vid hundra anrop i månaden är den akademisk, och volymargumentet ingår i samma helhetskalkyl som vi gått igenom i vad AI kostar.
Känslig data eller strikta krav. När underlaget är sådant att ni helst inte vill skicka det någonstans alls, källkod, prislistor, personuppgiftstunga flöden, är lokal drift ett sätt att göra hela överföringsfrågan irrelevant i stället för att hantera den.
Spegelbilden förtjänar samma tydlighet. En liten modell räcker inte när uppgiften kräver bred allmänkunskap, långa sammansatta resonemang eller kreativ kvalitet i öppen terräng. Assistenten som ska diskutera vad som helst med medarbetarna ska vara en stor modell hos en etablerad leverantör. Att tvinga in den uppgiften i en liten lokal modell ger sämre svar varje dag, för en besparing som inte motiverar det.
Hur ser en klok arkitektur ut?
Det praktiska svaret för de flesta SME är inte antingen eller utan en arbetsfördelning, och den är enklare än den låter. Låt en liten modell ta det första, högvolymssteget: sortera, extrahera, avgöra vad ett ärende gäller. Låt den skicka de svåra fallen vidare, till en stor modell eller en människa, enligt tydliga regler. Bygg växeln mellan modellerna som en vanlig integrationskomponent i er miljö, på samma sätt som vi beskrivit i integrera AI i befintliga system, så att modellerna förblir utbytbara delar snarare än fundament. Då kan ni byta liten modell när en bättre släpps, byta stor modell när prisbilden ändras och flytta gränsen mellan dem när erfarenheten växer. Det är samma poäng som återkommer i alla våra arkitekturresonemang: lösningens värde ska sitta i ert flöde och er data, inte i ett beroende till en enskild modell. Modellen är en komponent, flödet är tillgången.
Räkna också ärligt med driftsidan. En lokal modell är ett system ni förvaltar: uppdateringar, övervakning, säkerhet, kapacitet. För många är en svensk eller europeisk driftpartner den rimliga mellanvägen mellan full kontroll och full bekvämlighet.
Vad betyder det här framåt?
Trenden pekar mot att modellvalet blir mindre dramatiskt, inte mer. När små modeller klarar allt mer och priserna faller i den takt Stanford-siffrorna visar, förskjuts frågan från vilken modell till vilken arkitektur: hur flöden, data och kontroller byggs så att modellerna kan bytas som komponenter. Bolag som bygger så behöver aldrig mer göra ett stort modellbeslut, bara många små.
Undrar ni om era flöden passar en mindre modell?
Vi hjälper er bedöma vilka uppgifter som klarar en liten eller lokal modell och bygger arkitekturen där stora och små modeller samspelar, som en del av vår AI-utveckling. Boka ett samtal så räknar vi på ert konkreta fall. Teamet håller till i Stockholm och reser dit uppdraget finns, annars sköts det mesta på distans.
Vanliga frågor
Vad kostar det att köra en språkmodell lokalt?
Att köra en språkmodell lokalt kostar hårdvara eller EU-baserad driftmiljö plus förvaltning, i stället för avgift per anrop. För en mindre modell som löser en avgränsad uppgift kan det räcka med en enskild server eller ett måttligt molnåtagande, medan större modeller kräver dyrare GPU-kapacitet. Kalkylen vinner vid höga volymer på en väldefinierad uppgift och förlorar vid låg användning, där betalning per anrop nästan alltid är billigare.
Är en lokal modell säkrare för känslig data?
En lokal modell ger starkare kontroll över känslig data eftersom ingenting lämnar er miljö: inga prompter till extern leverantör, ingen tredjelandsöverföring att bedöma, full rådighet över loggar. Säkerheten kommer dock inte automatiskt, för driftmiljön måste skyddas som varje annat internt system. Rätt beskrivet byter ni bort leverantörsrisk mot eget driftansvar, vilket är en bra affär för vissa datakategorier och onödig möda för andra.