Les hele vår dekning av Mobile World Congress
På Mobile World Congress 2024 legger Qualcomm mer til sin portefølje av AI-på-telefon-triks tilrettelagt av Snapdragon-seriens silisium for Android-telefoner. Brikkeprodusenten har allerede vist frem noen imponerende AI-funksjoner for flaggskipet Snapdragon 8 Gen 3, for eksempel stemmeaktivert medieredigering, bildegenerering på enheten ved hjelp av stabil diffusjon og en smartere virtuell assistent bygget oppå store språkmodeller fra slike som Meta.
I dag legger selskapet mer grynt til disse AI-superkreftene. Den første er muligheten til å kjøre en Large Language and Vision Assistant (LLaVa) på en smarttelefon. Tenk på det som en chatbot som ChatGPT som har fått Google Lens-evner. Som sådan kan Qualcomms løsning ikke bare akseptere tekstinndata, men også behandle bilder.
Du kan for eksempel skyve et bilde som viser en charcuteribrett og stille spørsmål basert på det. AI-assistenten, basert på en stor multimodal modell (LMM) som kan behandle over 7 milliarder parametere, vil da fortelle deg alle typer frukt, oster, kjøtt og nøtter på tavlen som er avbildet i inndatabildet nedenfor.

Den kan også håndtere oppfølgingsspørsmål, slik at du kan føre en flytende frem og tilbake samtale. Nå har slike som ChatGPT også fått flere-modale muligheter, noe som betyr at OpenAIs verktøy også kan behandle bildeinndata. Det er imidlertid en avgjørende forskjell.
Produkter som ChatGPT og Copilot er fortsatt knyttet til en skybasert arkitektur, noe som betyr at dataene dine håndteres på eksterne servere. Qualcomms push er i retning av prosessering på enheten. Alt skjer på telefonen din, noe som betyr at hele prosessen går raskere, og det er liten risiko for personverninntrenging.
«Denne LMM kjører med en responsiv tokenrate på enheten, noe som resulterer i forbedret personvern, pålitelighet, personalisering og kostnader,» sier Qualcomm. Hvorvidt Qualcomms lovede LLaVa-baserte virtuelle assistent kommer som en frittstående app eller om den vil ha en avgift er ennå ikke offisielt bekreftet.
Den neste kunngjøringen fra Qualcomm dykker ned i det kreative domenet for bildegenerering og manipulering. For ikke så lenge siden demonstrerte Qualcomm verdens raskeste tekst-til-bilde-generering på en telefon ved hjelp av Stable Diffusion-teknologi. I dag gir selskapet et første glimt av LoRA-drevet bildegenerering.

LoRA tar en annen tilnærming til bildegenerering enn et vanlig generativt AI-verktøy som Dall.E. LoRA, forkortelse for Low-Rank Adaptation, er en teknikk utviklet av Microsoft. Å trene en AI-modell kan være ganske kostnadskrevende, høy ventetid og spesielt krevende fra et maskinvareperspektiv.
Det LoRA gjør er at den reduserer modellvekten dramatisk, et mål som oppnås ved kun å fokusere på spesifikke segmenter av modellen og redusere antall parametere for treningsformål. Ved å gjøre det går minnekravene ned, prosessen blir raskere, og tiden og kreftene det tar å tilpasse en tekst-til-bilde-modell synker også dramatisk.
Over tid har LoRA-destillasjonsteknikken blitt brukt på Stable Diffusion-modellen for å generere bilder fra tekstmeldinger. På grunn av effektivitetsgevinsten og den lettere tilpasningsevnen til LoRA-baserte modeller, blir den sett på som en skreddersydd rute for smarttelefoner. Qualcomm mener det absolutt, og til og med rivalen MediaTek har omfavnet den samme løsningen for generative AI-triks på flaggskipet Dimensity 9300-brikken.
Qualcomm viser også noen andre AI-triks på MWC 2024, hvorav noen allerede har dukket opp på Samsung Galaxy S24 Ultra. Blant dem er muligheten til å utvide lerretet til et bilde ved å bruke generativ AI-fyll og AI-drevet videogenerering. Sistnevnte er ganske ambisiøs, spesielt etter å ha sett hva OpenAI har oppnådd med Sora. Det ville vært interessant å se hvordan Qualcomm klarer å overføre det til smarttelefoner.
Støtt vårt arbeid ❤️
Hvis du likte denne artikkelen, vurder å gi en tips for å hjelpe oss med å fortsette å publisere kvalitetsinnhold.




















