Om prosjektet
Hva om du kunne søke i et lydbibliotek på samme måte som du tenker – "knirkende dør i gammelt hus" eller "regn mot bilvindu", i stedet for å lete gjennom filnavn og manuelle tagger?
Soundly er et norsk teknologiselskap som utvikler løsninger for profesjonell lydhåndtering og lydsøk. I møte med stadig voksende lydbiblioteker så de behovet for mer intelligente og automatiserte metoder for å finne, beskrive og organisere lydfiler. Gjennom kontakt mellom gründerne i Soundly og Append oppstod et samarbeid om å utforske hvordan moderne AI-modeller kan gjøre lydarkiv semantisk søkbare, der man finner lyder basert på betydning, ikke bare filnavn eller metadata.
Utfordring
Tradisjonelt lydsøk er avhengig av at noen manuelt har navngitt og tagget hver eneste fil, et arbeid som skalerer dårlig når bibliotekene vokser til hundretusener av lyder. Soundly trengte en løsning som kunne finne semantisk lignende lyder automatisk, og som på sikt kunne beskrive og tagge lydfiler uten menneskelig involvering. Utfordringen var å bygge bro mellom naturlig språk og rå lyd.
Løsning
Løsningen bygger på Contrastive Language-Audio Processing (CLAP), en modelltype trent til å koble språk og lyd i et felles representasjonsrom. Det betyr at en tekstbeskrivelse og en lydfil kan sammenlignes direkte matematisk: systemet beregner likheter mellom lyder og tekst, og finner dermed lyder som "ligner" basert på innhold, ikke bare akustiske egenskaper.
Gjennomføring
En forhåndstrent CLAP-modell brukes til semantisk søk etter lignende lyder.
FAISS sørger for effektivt likhetssøk selv i store lydmengder.
Et PyQt-basert grensesnitt brukes til testing og visualisering av resultatene.
Løsningen er bygget for skalerbarhet i Google Cloud, slik at den enkelt kan utvides til større datamengder eller integreres i Soundlys eksisterende tjenester.
Resultater
Fundamentet som er lagt, semantisk søk i et felles språk-lyd-rom, åpner for automatisk beskrivelse og tagging av lydfiler som neste steg, og arkitekturen er forberedt for integrasjon i Soundlys tjenester.
Teknologi
- Small Language Models (SML)
- Contrastive Language Audio Processing (CLAP)
- PyQT
- FAISS
- Pytorch
- Pytorch Lightning
- Google Cloud
- ...
Dato: 1.8.2024

