Alle prosjekter
Soundly-logo

Semantisk søk i lyd

  • AI

Kort beskrivelse

Med AI-modeller som kobler språk og lyd kan Soundlys brukere finne lyder basert på hva de betyr, ikke bare hva filene heter.

Om prosjektet

Hva om du kunne søke i et lydbibliotek på samme måte som du tenker – "knirkende dør i gammelt hus" eller "regn mot bilvindu", i stedet for å lete gjennom filnavn og manuelle tagger?

Soundly er et norsk teknologiselskap som utvikler løsninger for profesjonell lydhåndtering og lydsøk. I møte med stadig voksende lydbiblioteker så de behovet for mer intelligente og automatiserte metoder for å finne, beskrive og organisere lydfiler. Gjennom kontakt mellom gründerne i Soundly og Append oppstod et samarbeid om å utforske hvordan moderne AI-modeller kan gjøre lydarkiv semantisk søkbare, der man finner lyder basert på betydning, ikke bare filnavn eller metadata.

Utfordring

Tradisjonelt lydsøk er avhengig av at noen manuelt har navngitt og tagget hver eneste fil, et arbeid som skalerer dårlig når bibliotekene vokser til hundretusener av lyder. Soundly trengte en løsning som kunne finne semantisk lignende lyder automatisk, og som på sikt kunne beskrive og tagge lydfiler uten menneskelig involvering. Utfordringen var å bygge bro mellom naturlig språk og rå lyd.

Løsning

Løsningen bygger på Contrastive Language-Audio Processing (CLAP), en modelltype trent til å koble språk og lyd i et felles representasjonsrom. Det betyr at en tekstbeskrivelse og en lydfil kan sammenlignes direkte matematisk: systemet beregner likheter mellom lyder og tekst, og finner dermed lyder som "ligner" basert på innhold, ikke bare akustiske egenskaper.

Gjennomføring

En forhåndstrent CLAP-modell brukes til semantisk søk etter lignende lyder.

FAISS sørger for effektivt likhetssøk selv i store lydmengder.

Et PyQt-basert grensesnitt brukes til testing og visualisering av resultatene.

Løsningen er bygget for skalerbarhet i Google Cloud, slik at den enkelt kan utvides til større datamengder eller integreres i Soundlys eksisterende tjenester.

Resultater

Fundamentet som er lagt, semantisk søk i et felles språk-lyd-rom, åpner for automatisk beskrivelse og tagging av lydfiler som neste steg, og arkitekturen er forberedt for integrasjon i Soundlys tjenester.

Teknologi

  • Small Language Models (SML)
  • Contrastive Language Audio Processing (CLAP)
  • PyQT
  • FAISS
  • Pytorch
  • Pytorch Lightning
  • Google Cloud
  • ...

Dato: 1.8.2024

Vil dere ha noe lignende?

Vi hjelper dere gjerne med å finne den beste løsningen for behovet deres.

Snakk med oss om lignende løsning