Hoppa till innehåll

Blogg

Datakvalitet inför AI: så blir datan redo

August Calles4 min läsning

Det minst spännande skälet till att AI-projekt misslyckas är också ett av de vanligaste: datan höll inte. Modellen får all uppmärksamhet, men det är datan under den som avgör utfallet. Gartner har bedömt att organisationer fram till 2026 överger omkring 60 procent av de AI-projekt som saknar tillräckligt förberedd data. Det är ingen modellbrist. Det är en datakvalitetsbrist.

Datakvalitet inför AI mäter om den information en lösning ska använda är komplett, korrekt, konsekvent, aktuell och åtkomlig, alltså om den går att lita på, inte om den är modern eller stor. En enkel insikt med stora konsekvenser, för en lösning ärver datans brister och förstärker dem.

En AI-lösning blir aldrig bättre än datan den vilar på. Datakvalitet avgör utfallet långt mer än vilken modell ni väljer.

Den goda nyheten är att datakvalitet går att bedöma och åtgärda, och att ni inte behöver perfekt data för att börja. Ni behöver rätt data, för rätt flöde, i tillräckligt skick.

Sex dimensioner att bedöma datan på

När vi tittar på om ett flöde är redo för AI går vi igenom datan längs sex enkla frågor.

  • Komplett. Saknas det uppgifter som behövs? Halva fält och tomma rader blir gissningar när lösningen ska använda dem.
  • Korrekt. Stämmer det som står där? Felaktig data är värre än ingen, för den ser pålitlig ut.
  • Konsekvent. Skrivs samma sak på samma sätt? Om en kund heter tre olika saker i tre system blir allt som bygger på det skakigt.
  • Aktuell. Är datan uppdaterad, eller speglar den hur det såg ut för två år sedan? Gammal data ger gamla svar.
  • Åtkomlig. Går datan att nå, med rätt behörigheter, eller ligger den inlåst i ett system ingen kommer in i?
  • Strukturerad nog. Vet ni vad som är vad? Information begravd i fritext och PDF:er går att använda, men kräver mer arbete än prydliga fält.

Notera att ingen av dimensionerna handlar om mängd. Lite data i gott skick slår mycket data i dåligt, varje gång.

Ni behöver inte perfekt data

Den vanligaste fällan är att tro att all data måste städas först. Det projektet blir aldrig klart, och under tiden händer ingenting. Vänd på det. En AI-lösning behöver bara datan för det flöde den ska stötta, och bara den behöver vara i skick.

Det gör problemet hanterbart. I stället för "städa företagets all data" blir uppgiften "se till att datan för det här ena flödet är komplett, korrekt och åtkomlig nog". Det är en avgränsad insats med ett tydligt slut, och den är en av anledningarna till att vi alltid förespråkar att börja smalt. Var datan brister för just det flödet framgår oftast redan när ni kartlägger processen.

Ett exempel gör det konkret. Ska ni automatisera orderbekräftelser behöver produktregistret vara komplett, priserna aktuella och kunduppgifterna konsekventa. Däremot spelar det ingen roll för det flödet att HR-datan är rörig eller att gamla projektmappar är ostädade. Avgränsningen avgör inte bara vad lösningen ska göra, utan exakt vilken data som måste hålla. Det är nästan alltid en mindre mängd än man först tror, och därmed ett arbete med ett tydligt slut i stället för ett bottenlöst städprojekt. Just därför är datakvalitet inte något ni gör en gång för hela företaget, utan en bedömning ni gör om och om igen, ett flöde i taget. Skillnaden mellan de två synsätten är ofta skillnaden mellan en lösning som blir av och en som fastnar i förberedelser.

Var datan oftast brister

Tre mönster återkommer. Datan är spridd, samma uppgifter ligger i flera system utan en samlad bild. Datan är inkonsekvent, dubbletter och olika stavningar gör den opålitlig. Och datan sitter i fritext, i mejl, anteckningar och dokument, där den finns men inte är lätt att använda.

Inget av det är ovanligt, och inget av det är ett stopp. Det är arbete som ska räknas med från början, inte upptäckas halvvägs in. Att veta var datan brister är i sig en del av att bedöma er AI-mognad, och det avgör i hög grad var ni bör börja.

Vill ni veta om er data är redo?

Vi bedömer datakvaliteten i de flöden ni vill stötta med AI och pekar ut vad som behöver åtgärdas, innan något byggs. Vill ni veta var ni står? Boka ett samtal, så går vi igenom er data tillsammans.


Vanliga frågor

Vad menas med datakvalitet inför AI?

Datakvalitet inför AI mäter om den information en lösning ska använda går att lita på: om den är komplett, korrekt, konsekvent, aktuell och åtkomlig. Det handlar inte om att datan är modern eller stor, utan om att den är tillräckligt ordnad för att ge tillförlitliga svar i det specifika flöde lösningen ska stötta.

Måste vår data vara perfekt innan vi börjar med AI?

Nej. Ni behöver inte städa all data i hela företaget, det blir aldrig klart. Ni behöver datan för det avgränsade flöde ni vill stötta, och den ska vara tillräckligt bra för just det. Bättre att ta ett smalt flöde med data i hyfsat skick hela vägen till drift än att vänta på en perfekt dataplattform som aldrig blir klar.

Vill ni omsätta AI till mätbart värde?

Boka ett samtal så går vi igenom era processer och var AI gör störst skillnad.

Kontakt

Boka samtal

Byron Calles är AI-konsulter i Stockholm med leverans i hela Sverige, on-site och remote. Fyll i formuläret så återkommer vi med tider. Ju mer kontext, desto snabbare kan vi föreslå rätt upplägg.

August Calles, grundare av Byron Calles

August Calles

Grundare

Vad är du intresserad av?