Jan Moberg snakker med DNVs sjefsforsker på AI, Kristian Agrell, om samarbeidet med NASA om usikkerhetskvantifisering, kvalitetssikring av AI-systemer, og konkurransen de har lansert for å finne metoder for tryggere drift av sikkerhetskritiske systemer.
00:00
DNV og NASA samarbeider om usikkerhetskvantifisering relatert til kunstig intelligens og risiko i komplekse systemer.
03:56
Usikkerhetskvantifisering i modellering for autonome systemer er avgjørende for å forstå konsekvensene av feil og usikkerhet.
09:55
Kristian forklarer hvordan DNV og NASA samarbeider om en konkurranse for å forbedre usikkerhetsmodeller i sikkerhetskritiske systemer.
16:49
Podcasten diskuterer usikkerhetskvalifisering i AI, viktigheten av maskinlæring, og kommende konkurranser for innovative løsninger.
Transkript
Nævnt i episoden
DNV
Selskapet til gjesten; jobber med risiko, usikkerhet og kvalitetssikring av AI-systemer.
NASA
Samarbeidspartner med DNV om usikkerhetskvantifisering og konkurranse.
Kristian Agrell
DNVs sjefsforsker på AI, gjest i episoden.
Jan Moberg
Podcastens programleder fra TU.
Teknisk Sett
Podcasten fra TU der episoden sendes.
Kunstig intelligens
Hovedtema: kvalitetssikring og usikkerhet i AI-systemer.
Usikkerhetskvantifisering
Forskningsfelt som tema for samarbeid og konkurranse.
ChatGPT
Nevnt som eksempel på språkmodeller.
Esrel
Konferanse i Stavanger der konkurranseløsningene skal vurderes.
TU
Utgiver av podcasten.
Deltagere
host
Jan Moberg
guest
Kristian Agrell
Sponsorer
Delta
Point
Modeller er ikke alltid 100 % nøyaktige, men det trenger de ikke heller være – så lenge du vet noe om usikkerheten i prediksjonene.
Et sentralt poeng i podkasten om at usikkerhetsinformasjon ofte er viktigere enn absolutt nøyaktighet.
Før var det bare fagmiljøene som brydde seg om risiko og usikkerhet rundt kunstig intelligens – vi følte vi skrapte på døra til folk. Nå er det snudd helt, og det er enorm etterspørsel.
Gir et interessant historisk perspektiv på hvordan synet på AI-risiko har endret seg de siste fem til ti årene.
Det verste som kan skje med Netflix sin anbefalingsmotor er at du himler med øynene – med et autonomt skip eller en rakett kan konsekvensene være katastrofale.
En god kontrast som viser forskjellen på risiko i forbruker-IT og sikkerhetskritiske fysiske systemer.
Det er egentlig bra at vi ikke har mye data om når systemer svikter – men statistisk sett er det en stor utfordring.
Et paradoksalt, men innsiktsfullt poeng: fravær av ulykkesdata gjør risikovurdering vanskeligere.
Alle som har jobbet med maskinlæring har vært borti det: modellen gir et feil svar, men er også skråsikker.
Beskriver 'high confidence mistakes' på en lett tilgjengelig måte.
Påstande
DNV feiret 160 år i fjor.
Kan sjekkes mot DNVs historie; DNV ble grunnlagt i 1864, så dette stemmer hvis podkasten er fra 2024.
DNV har et forskningssamarbeid med NASA relatert til usikkerhetskvantifisering.
Hovedtema i podkasten; kan verifiseres gjennom DNVs offisielle kanaler.
DNV jobber med kvalitetssikring av AI-systemer i sektorer som energi, helse og maritim industri.
Oppgitt av Kristian Agrell, DNVs sjefsforsker på AI.
NASA har tidligere kjørt lignende konkurranser to ganger, i 2014 og 2020.
Oppgitt i podkasten; kan sjekkes mot NASAs konkurransearkiv.
DNV deltok i NASAs tidligere konkurranse og endte opp med den beste løsningen.
Deltakerens egen fremstilling av historien bak samarbeidet.
Konkurransen startet 6. januar, og deltakerne skal jobbe med den frem til slutten av mars.
Oppgitt tidsramme for konkurransen.
Over 100 deltakere fra hele verden har startet på konkurransen.
Oppgitt antall deltakere; kan sjekkes mot konkurranseplattformen.
Løsningene skal presenteres og kåres på konferansen Esrel i Stavanger, nærmere sommeren.
Oppgitt plan for oppfølging av konkurransen; Esrel er en reell internasjonal konferanse om risiko og pålitelighet.
Deltakerne i konkurransen vet ikke hvilket fysisk system simuleringen representerer.
Systemet er bevisst holdt skjult ('black box') fordi oppgaven er disiplin-uavhengig.
Tidlige autonome biler hadde problemer med å gjenkjenne syklister og klarte ikke å si at de var usikre, noe som førte til ulykker.
Oppgitt som eksempel; kan sammenlignes med kjente hendelser med autonome biler.
I et eksperiment trente DNV en maskinlæringsmodell til å skille mellom motorbåter, seilbåter og kajaker, og modellen predikerte bilder av fyrtårn som kajaker med nesten 100 % sannsynlighet.
Konkret eksempel på 'high confidence mistakes' fra DNVs eget arbeid.
Kristian Agrell er matematiker og har doktorgrad i maskinlæring for høyrisikoanvendelser, og er DNVs sjefsforsker på AI.
Presentasjon av gjesten; kan verifiseres mot DNVs offisielle informasjon.
Loader
Nå kan jeg endelig snakke om andre ting med kona før vi legger oss. For eksempel hvordan dagen har vært.
Snakk med oss i Delta. Fagforeningen som hører deg.
Du hører på Teknisk Sett, en podcast fra TU. Mitt navn er Jan Moberg, og i dag har jeg fått DNV på besøk her til TU. Vi skal snakke med DNV sin sjefsforsker på AI, Kristian Agrell. Velkommen. Tusen takk. Du, vi må bare avsløre og få lytterne med en gang at dere har inngått et samarbeid i DNV med NASA av alle ting. Det er jo romsky på målene og det er space og alt mulig. Ja.
Det stemmer. Før vi kommer og forteller mer om det, så må vi fortelle litt om bakgrunnen for at akkurat dere i DNV har et samarbeid med NASA. Samarbeidet er et forskningssamarbeid relatert til noe som heter usikkerhetskvantifisering. Jeg skal gjøre litt forsøk på å forklare hva det er for noe.
Først skal jeg si at i ideen min har vi jobbet med risiko lenge. Vi feiret 160 år i fjor. Også innen forskningsenheten har vi jobbet mye med forskning på risiko og usikkerhet i lang tid. Nå er det også relatert til kunstig intelligens og AI. Fordi vi driver med kvalitetssikring av AI-systemer. Det er ikke bare skip lenger? Nei, vi jobber inn typisk systemer inn energi, innvarutim, inn helse.
Og her er ikke dette med kunstig intelligens noe nytt. Altså nå tenker man mye på språkmodeller som chat, GPT og Copilot og sånn som brukes av alle, ikke sant? Men til mer industriell bruk så har man, for eksempel i energiproduksjon, tatt i bruk kunstig intelligens i lang tid. Og det er da maskilæring som er populært i dag, men også mer sånn manuelt programmert ekspertsystemer har man brukt lenge da.
Så vi har litt erfaring med det her, og vi har jo da fått erfaring at når man, altså med økt digitalisering og mer autonomi, mer bruk av kunstig intelligens, så ser vi at de systemene blir mer komplekse. Så det betyr at vi trenger nye metoder og verktøy for å håndtere usikkerhet og risiko. Og jeg tror altså, det her er...
Hvis vi går fem til ti år tilbake i tid, så var det nok ikke så veldig mange som brydde seg om det her. Det var mest i fagmiljøene og forskningsmiljøene at man jobbet med risiko og usikkerhet rundt digitale systemer og kunstig intelligens.
Jeg tror vi følte litt at vi skrapet på døgn til folk, spesielt hvis vi skulle snakke om risiko og kunstig intelligens. For å få det ut å forstå som kunne skje? Ja, og hvorfor det er viktig med nye metoder, og hvorfor det er relevant i det hele tatt. Men det har alltid vært, eller lenge vært, et veldig viktig tema i forskning.
Men nå er det jo snudd helt, altså nå er det jo en enorm etterspørsel etter løsninger for å kontrollere risikoer relatert til kunstig intelligens. Er dette også fordi at vi ser på KI-systemet litt som en sort boks og ikke helt klarer å sitte hands-on og vite hva de gjør? Ja, det er en veldig viktig del av det. Det er som du sier, det er komplekse modeller, det er litt sånn sorte bokser, og man har ikke helt kontroll alltid på hvordan de fungerer. Ja.
Og så i hvor stor grad er da, hvis noe først går galt, så er rekkefølgen av ting som kan skje og størrelsen på konsekvensen større enn før? Ja, det er topp. Og det skjer også da typisk mye større skala. Så det er da viktig for oss å på en måte forstå både hva er potensialet, hva er det som kan gå galt, og hva er usikkerheten relatert til det.
Og det er akkurat her vi har samarbeidet med NASA, for dette er et tema som på en måte, et forskningsområde som kalles usikkerhetskvantifisering, som handler om usikkerhet i modeller egentlig. Du må ha et forhold til hvor stor usikkerhet du går inn i. Nettopp. Så dette forskningstemaet hvor vi samarbeider med NASA. Men før vi går dit så, for lytteren, er det noen konkrete eksempler på dette med usikkerhet i modeller?
Ja, altså... Som dere har vært innom. Når vi snakker om usikkerhetskvantifisering, så handler det i bunn og grunn om usikkerhet i modeller. Modeller kan være for eksempel å si du skal beregne hvor mye en struktur tåler. Altså, du skal designe et skip som skal tåle en storm, eller du vil finne ut hvor mye snø kan være på taket før huset kollapser. Da bruker vi fysikkmodeller som regner ut spenninger og tøyninger, for eksempel.
Og et annet eksempel, vi bruker for eksempel maskinlæringsmodeller. La oss si du har en autonom bil, så må den basert på video og bilder, må kunne klare å detektere objekter og egentlig gjennom prediksjon på hva som er på bildet. Ja, så med autonomien som kommer nå, så blir jo dette ekstra viktig. Ja, det er kjempeviktig. Og så må du ikke få svar i løpet av millisekunder. Akkurat. Ja.
Og det kan man. Med maskinlæringsmodeller er de skrudd sammen på en litt annen måte enn fysikkmodeller. Det er trent og basert på masse eksempler fra data, men det er riktig nok en modell og noe som kanskje ligner mer på statistiske modeller. Under covid ble vi veldig godt kjent med statistiske modeller for å estimere smittespredning blant annet.
Når vi holder på med modellering og usikkerhetskvalifisering, så handler det om produksjonen fra modeller. Vi vet at alle som har prøvd å lage en modell eller bruke modeller, og det kan hende at det er noen av lytterne som har erfaring med, og de vet at modellene ikke alltid er 100% nøyaktige.
Nei, men enkelte ganger trenger det jo ikke være det heller. Nei, nettopp. Hvis du vet noe om usikkerheten i prediksjonene, så trenger det ikke være så nøyaktig. Et eksempel, som illustrerer det godt, er et litt gammelt eksempel fra en del år tilbake. Et veldig enkelt eksempel, men det illustrerer et problem som er veldig relevant i dag.
Vi lagde en, altså det her use case her var akkurat som autonome biler, så med autonome skip så må vi ha muligheten til å basert på bilder kunne gjenkjenne objekter på sjøen. Så vi tok en maskinlæringsmodell og trent den opp til å da kunne se forskjell på forskjellige typer båter. Så vi hadde bare da, vi tok bilder av motorbåter, seilbåter og kajaker. Så veldig trivielt og enkelt.
Og der kunne vi fint trene opp en modell som kunne se forskjell på disse tingene, og den gjorde det ganske bra. Og så viste vi denne modellen bilder noen aldri hadde sett før, disse bildene av et fyrtårn, og det var ikke sånn at vi forventet at den modellen skulle klare å detektere eller skrive av det fyrtårnet. Nei, hadde du ikke sett det før? Nei, ikke sant? Altså det er ikke i vokabularet til modellen, så det går ikke an, ikke sant?
Og det er helt greit. Jeg tror den typisk så predikerte den da at disse fyrtårnene var kajaker. Stående kajaker, ja. Ja, noe sånt da. Og det er greit, ikke sant? Vi forventer ikke at den skal gi riktig svar, men det som er interessant var når vi begynte å grave i, man kan også finne ut hva er sannsynligheten for de forskjellige prediksjonene. Så hva er sannsynligheten for at det er en kajak?
Og det er 100%, så da skrås ikke på det. Og det er alle som har jobbet litt med maskinlæringsmodeller, kan ha en ankomst borti det her, at hvis man
prøver å bruke modellene på noe som er litt utenfor det den er tredd på, noe den ikke har sett før, altså gir en feilsvar, men som er også skråsikker. Ja, ja, ja, nettopp. Fenomen som kalles high confidence mistakes på fagspråket. På den andre siden da, hvis du tar et autonom bil for eksempel, og den detekterer hvorvidt det er en
en Tesla eller en Volvo som sparer veien for deg, så er det jo litt same same. Så det er jo enkelt områder du kan godta at du ikke må treffe. Så dette er jo et utrolig interessant område. Det er helt riktig, så noen ganger er det ikke så viktig, akkurat nøyaktigheten, andre ganger er det viktig. Innenfor autonome biler har det vært et problem at de tidlige modellene klarte ikke å gjenkjenne sykler,
De klarte heller ikke å si at de var usikre på hva det var for noe, og det følte noen ulykker. Vi beveger oss inn i en usikker verden, men i hvor stor grad, vi skal jo komme tilbake til NASA, men dette er veldig interessant, i hvor stor grad kan du da eventuelt i stedet for å ha en KI-modell som skal gi deg svaret, ha et knippe med KI-modeller som hver har sin sektor av usikkerhet?
Ja, det er faktisk en måte å gjøre det på, altså å ha flere varianter, og så se når de er enige eller ikke. Men i bunn og grunn så er det, altså når vi jobber med det her fagfelt usikkerhetskvantifisering, så handler det om å da ta en modell og få den til å gi gode estimater på usikkerhet.
Du får jo, Kristian, til å høre dette med usikkerhetsmodeller til å høre mer anvendelig ut enn sært, faktisk. Jeg tenkte at dette er jo litt sært, men det er veldig viktig. Ja, det er det. Og det er faktisk veldig nyttig også, fordi en ting er at det er mange anvendelser hvor det er viktig å vite noe om usikkerhet, men si hvis du vet da
hvilke scenarier er modellen usikker, og så kan du også finne ut av hvilke scenarier er det den usikkerheten faktisk har noe å si. Da vet du akkurat hvordan du skal forbedre modellen på en god måte. Og her kommer vi, det er en bra passasje over egentlig, for dere har nå, DNV, har sammen med NASA invitert verdens fremste eksperter til å løse en matematisk utfordring som skal bidra til å optimalisere beslutningsprosesser
med akkurat dette med høy usikkerhet. Bare kjapt, DNV og NASA, jeg tenker DNV Maritimt og NASA Space, dere har spekter hos dere, det er naturligvis mye større nå, men kort fortalt, hvor lang har denne relasjonen vært? Ja, grunnen til at DNV og NASA jobber sammen på dette temaet, er for det første for oss begge, så er det veldig viktig,
For det andre er det utrolig vanskelig. Vi jobber med litt forskjellige områder. Vi er opptatt av skip, plattformer, vindturbiner, ting som er på land, på vann og på avbunden, mens NASA er mer opptatt av det som er i atmosfæren eller utenfor.
Når det kommer til usikkerhetskvantifiseringen, så spiller ikke det noen rolle. Det som vi har felles er at vi jobber med komplekse fysiske systemer, hvor konsekvensen av en feil eller ulike kan være katastrofal og gå utover og ramme liv og verdier og miljø. For å sette på spissen, så kan du si at du tenker på de modellene som Netflix bruker for å anbefale en ny tv-serie, eller Amazon, når de skal reklamere for noe.
Det er ikke den usikkerheten i prediksjonen som er veldig viktig. Altså, det verste som skjer, det er at du... Jeg himler med øynene, som bruker. Ja, og så kjøper du ikke den stekkepanna, ikke sant? Nei, det er helt riktig. Og så får du jo input da med dobbeltommler opp, eller en tommel opp, eller en tommel ned. Ja, ja, ja. Den lærer jo selvfølgelig noe av det. Så den lærer å bli bedre, men det er på en måte ikke krisevisning og alt. Neida, det er helt riktig. Men med et autonomt skip, for eksempel, så er jo noe helt annet da.
Ja, og dere hadde jo et annet eksempel her med beregning av vibrasjoner på romfartøy. Vi har jo sett at det går galt på himmelen noen ganger med oppskytningen, og det kan være mange... Ikke sant? Og du har ikke så veldig mange forsøk, så du må jo få det riktig med en gang. Og det er det som gjør det vanskelig. Vi jobber med komplekse fysiske systemer, og det betyr at vi også har ganske komplekse modeller.
Og så sliter vi med at vi har ganske lite relevant data. Nå snakker man jo ofte at man har mye data, og vi har jo egentlig det, altså vi har masse data om sånn daglig drift, altså en typisk dag på sjøen. Det er kanskje ikke strukturert godt da? Det er godt strukturert, og det kan være bra kvalitet, men det vi trenger er jo, det er noen veldig viktige datapunkter som forteller oss hva skjer når vi pusher disse systemene til grensene, ikke sant? Hva er det som skal til for at systemet feiler, at ting går i stykker?
Det er egentlig bra at vi ikke har så mye data på det, men fra et statistisk ståsted er dette en stor utfordring. Men det dere har gått sammen med NASA om å gjøre nå, det er å lansere en konkurranse faktisk, og finne frem til løsninger og metoder for tryggere drift av sikkerhetskritiske systemer. Kan du fortelle litt mer om det? Er denne konkurransen lansert? Hvem er det som melder seg på? Hva ser dere etter?
Ja, altså det her, NASA har kjørt sånne konkurranser to ganger før, det var i 2014, også en gang i 2020. Da var vi med som deltakere, og vi endte opp med den beste løsningen. Ah, så det er en vei inn til NASA. Akkurat. Å vinne en sånn, ja. Så det var egentlig starten på et samarbeid, og at vi da ble enige om at vi nå kjører denne konkurransen her sammen, da.
Måten vi har gjort det på her er at vi har laget oss et fysisk system, og så har vi laget en simulerings- og en prediksjonsmodell, så alle de som er med på den konkurransen her får tilgang på den. De kan laste med den og kjøre den på sin egen PC. Så har vi utfordret dem på noen spesifikke oppgaver relatert til usikkerhetskvantifisering og hvordan optimere beslutninger i dette systemet under usikkerhet.
Men det som er viktig er at deltakerne vet ikke hva slags system det er. Altså det her er egentlig noen black box som de laster ned, og de putter noe inn og får ut noen tidsserier. Og det er fordi det har egentlig ikke så mye å si om de hadde visst hvilket system det er. Altså dette er en ganske disiplin-uavhengig oppgave. Men det er heller ikke en oppgave for hvem som helst. Nei, altså det her er...
Nå har vi godt over 100 deltakere som har startet på dette fra over hele verden. Det er professorer, forskere, folk som jobber i industrien, studenter som nå skal jobbe med dette frem til slutten av mars.
Spennende. Dette er en konkurranse som er lansert, og dere har fått påmeldt, kaller det lag? Ja, så vi startet 6. januar, da fikk de tilgang til modellen, og så hender det at det kommer noen som melder seg på etter hvert, og så får de litt ordentlig tid da.
Men så skal vi kjøre det nå fram til i mars, og så skal vi møtes nærmere sommeren på en konferanse som heter Esrel i Stavanger, hvor vi da skal møtes alle sammen og se på de forskjellige løsningene. Som deltakerne har levert. Ja. Så det som de, da prøver de å finne på en måte, de skal finne en god måte å kontrollere et system på underhusikkerhet. Mhm.
ved hjelp av noen modeller som de kan kjøre, og så må de ha mulighet til å teste det her i et faktisk system. Og det hadde vært fryktelig gøy hvis vi ikke hadde bygd dette fysiske systemet og gitt alle tilgang. Men vi har jo labber i DNV som vi kunne gjort dette her i stor skala, men da hadde det vært litt upraktisk og litt dyrt. Ja, men når du snakker om DNV, og dere er jo store og har ressurser og
vært ute noen polarnetter før på ting som har hent og med risiko og greier, og det har NASA. Hvilke type miljøer er det som melder seg på en sånn konkurranse egentlig?
Det her er jo typisk i dette fagmiljøet, relatert til usikkerhetskvalifisering, så er det blanding av folk med statistikk, matematikk, fysikk bakgrunn, eller mange innenfor data science og computer science som vi jobber med. Det er jo en veldig tett kobling mellom det her og maskinlæring som brukes i kunstig intelligens.
Ja, dette blir spennende. Vi får jo snakkes igjen da etter midten av juni, når dere kanskje har... Skal det kåres noen da? Er det da dommen faller, eller? Ja, så i juni vil vi da få se på en måte de forskjellige løsningene og kåre på en måte vinner i forskjellige kategorier. Du, avslutningsvis Kristian,
Hvordan kan dette bedre, altså på hvilken vis bedre dette tilbudet fra DNV? Kunder og partner i DNV? Ja, altså dette her tema og mulige løsninger her er viktig for oss av forskjellige grunner egentlig. Altså
Vi bruker på en måte mye maskinlæring når vi jobber med usikkerhetskvantifisering, så jeg tror det å kunne se de siste gjennombrudene der, effekten av det, er veldig viktig for oss. For vi trenger å forstå både hvordan vi kan vurdere usikkerhet i våre egne modeller, og i modeller til kundene våre når vi skal gjøre kvalitetssikring av AI-systemer.
Spennende. Hva er på det med risikovurdering? Jeg vet ikke om du er riktig person der, men i hvor stor grad, hva er det nye der? Er det noen nye forhold dere må ta hensyn til? Det ene er jo datakraft, det andre er klimaendringer. Spekter er jo stort her. Antallet av parametre som nå skal suges inn i sånne modeller blir jo skyhøyt.
Altså det, nå er det mye snakk om det som kalles Responsible AI og Trustworthy AI, og det handler om at de som lager eller bruker systemene med kunstig intelligens, de må sørge for at de er tilstrekkelig trygge og robuste, men også at de har egenskaper som at de er tilstrekkelig rettferdige og forklarbare, for eksempel da.
Og utviklingen går jo fortsatt i svært høyt tempo. Utviklingen går jo vanvittig fort, og klart skal vi ha kontroll på det her, så må vi ha kontroll på usikkerheten i disse modellene.
Kristian Agrell, DNVs sjefforsker på AI, bare takk for dette her. Du er jo matematiker og doktorgrad i maskinlæring for høyrisikoanvendelser, og du kan sikkert kose deg med alle disse entriene dere får til denne konkurransen. Jeg tror jeg fornøyer meg med å få svaret når dere er ferdige. Jeg skal ikke delta. Nei, du er hjertelig velkommen. Men takk til deg, og lykke til videre. Mitt navn er Jan Moberg.