Om prosjektet
Hvor mye innoveres det egentlig i offentlig sektor – og hvor? Svaret ligger i tusenvis av årsrapporter og tildelingsbrev.
Digitaliseringsdirektoratet fikk tidlig i 2024 i oppdrag fra DFD å utvikle et kunnskapsgrunnlag om innovasjonspraksis i offentlig sektor. I stedet for å sette av flere månedsverk til manuell lesing, kontaktet Digdir oss for å høre hvordan AI kunne brukes på en slik problemstilling. Mulighetene virket lovende, og Digdir lyste ut en konkurranse, som Append vant.
Utfordring
Oppgaven var å analysere tusenvis av offentlige dokumenter for å forstå hvor og hvordan det jobbes med innovasjon. Manuell gjennomgang ville vært svært tidkrevende og umulig å skalere. Digdir trengte en metode som ga både tall og innhold: kvantitativ oversikt på tvers av dokumenter, virksomheter og departementer, og kvalitativ innsikt i hva innovasjonsarbeidet faktisk består i.
Løsning
Dokumentene ble hentet fra den offentlige dokumentdatabasen Kudos. Opprinnelig tilbød vi å utvikle egne algoritmer for scraping og parsing av PDF-er, men underveis fant vi ut at Kudos' eget API leverte tekst av god nok kvalitet. Vi valgte derfor å bruke API-et, og utvidet heller andre deler av leveransen for pengene.
Gjennomføring
Kjernen i analysen er en embeddingmodell som gjør tekstavsnitt om til vektorer. Hvert avsnitt sammenlignes med en referansetekst om innovasjon, og får en "innovasjonsfrekvens" – et mål på hvor mye avsnittet handler om innovasjon.
Resultatene ble gjort tilgjengelige på flere måter:
Opplisting av avsnittene med høyest innovasjonsfrekvens, inkludert fargekodede PDF-er som viser hvor i dokumentet innovasjonen omtales.
Aggregering av frekvenser på dokument-, virksomhets- og departementsnivå, slik at nivåene kan sammenlignes.
Oppsummeringer generert med GPT-3.5 og GPT-4 på ulike nivåer.
Diagrammer og grafer som viser trender og mønstre i innovasjonsarbeidet.
Resultater
Leveransen ga Digdir et dokumentert og gjenbrukbart kunnskapsgrunnlag:
Digdir fikk et komplett datasett med innovasjonsfrekvenser og oppsummeringer, figurer og visualiseringer, en omfattende rapport og en presentasjon av metode og funn.
Hele kodebasen ble publisert som åpen kildekode på GitHub, med grundig dokumentasjon – slik at verktøyet kan oppdateres og videreutvikles, av Digdir eller andre.
Analysen kan kjøres på nytt når nye dokumenter kommer til, i stedet for å være en engangsøvelse.
«Det har vært svært lærerikt å jobbe med Append. Deres kompetanse på ny teknologi og kunstig intelligens åpnet for nye muligheter til å effektivt sammenstille store mengder data på kort tid»
Teknologi
- GPT-modeller
- Embeddingmodeller
- Python
- Pandas
- Plotly
Dato: 1.3.2024
