Viktige takeaways
- LAM-er er AI-systemer som kan forstå menneskelige input og utføre tilsvarende handlinger, og bygger på LLMs evner.
- LAM-er kan utføre komplekse oppgaver, som å bestille en kaffe eller gjøre en hotellreservasjon.
- Selv om LAM-er har løfter for fremtiden, er de ennå ikke klare for utbredt bruk, noe som fremgår av at Rabbits r1-enhet ikke klarer å utføre mange av de annonserte funksjonene.
Fremveksten av generative AI-chatbots har popularisert begrepet «stor språkmodell», den underliggende AI-teknologien som jobber bak kulissene. Store språkmodeller (LLM) genererer utdata basert på et forutsagt sett med språk som svar på brukerinndata, noe som får det til å se ut som om AI er i stand til å tenke selv.
Men LLM-er er ikke de eneste store modellene i byen; store handlingsmodeller (LAM) kan være den neste store tingen innen AI.
Hva er en stor handlingsmodell (LAM)?
En LAM er et kunstig intelligenssystem som er i stand til å forstå menneskelig input og utføre en tilsvarende handling. Dette er en litt annen tilnærming til AI-systemer som utelukkende fokuserer på å generere svar. Begrepet «stor handlingsmodell» ble først introdusert av Rabbit Inc., utviklere av rabbit r1-enheten. I selskapets rabbit r1-lanseringsvideo står det at en LAM er en ny grunnleggende modell som hjelper til med å bringe AI fra ord til handling.
LAM-er er trent på store datasett med brukerhandlingsdata; derfor lærer de ved å imitere menneskelige handlinger eller gjennom demonstrasjon. Gjennom demonstrasjon kan LAM-er forstå og navigere i brukergrensesnittene til forskjellige nettsteder eller mobilapplikasjoner og utføre spesifikke handlinger basert på instruksjonene dine. Ifølge Rabbit kan en LAM oppnå dette selv om grensesnittet endres litt.
Du kan tenke på LAM-er som en utvidelse av de eksisterende mulighetene til LLM-er. Mens LLMs generative tekst eller medieutdata basert på brukerinndata ved å forutsi neste ord eller token (du stiller et spørsmål, og en LLM gir en tekst eller mediautgang), tar LAM det videre ved å legge til muligheten til å utføre komplekse handlinger på dine vegne .
Hva kan LAM-er gjøre?
LAM-er handler om å utføre komplekse handlinger på dine vegne. Det kritiske punktet å merke seg er imidlertid evnen til å utføre komplekse handlinger. Dette gjør LAM-er mer nyttige i å utføre avanserte oppgaver, men det betyr ikke at de ikke kan utføre enklere handlinger.
I teorien betyr dette at du for eksempel kan be en LAM om å gjøre noe på dine vegne, som å bestille en kaffe fra Starbucks i nærheten, en tur fra Uber og til og med foreta en hotellreservasjon. Det er derfor forskjellig fra å utføre enkle oppgaver som å be Google Assistant, Siri eller Alexa om å slå på TV-en eller stuelysene.
Under panseret, i henhold til visjonen som deles av Rabbit Inc., er LAM i stand til å få tilgang til den relevante nettsiden eller appen som Uber og navigere gjennom grensesnittet for å foreta en handling, for eksempel bestille en tur eller kansellere en hvis du ombestemmer deg.
LAM-er vil lykkes med LLM-er, men de er ikke klare (ennå)
Konseptet med LAM-er er spennende, kanskje enda mer enn LLM-er. LAM-er vil være fremtiden etter generativ AI, noe som gjør oss i stand til å kompensere for hverdagslige oppgaver og fokusere på andre tilfredsstillende aktiviteter. Men så spennende som de virker, LAM-er er ikke klare ennå.
Det første kommersielle produktet som lovet å utnytte en LAM (kaninen r1) innfridde ikke fullt ut markedsføringsløftet om å utføre handlinger på vegne av brukerne. Enheten mislyktes så spektakulært på sitt kjernesalgspunkt at mange førstehåndsanmeldelser betegnet den som ganske ubrukelig.
Enda verre, en undersøkelse av Coffeezilla, en YouTuber, i samarbeid med en utvalgt gruppe programvareingeniører med tilgang til en del av r1s kodebase, fant at Rabbit brukte Playwright-skript for å utføre handlinger i stedet for en LAM. Så i stedet for en enhet som kjører en unik AI-modell, var det faktisk bare å kjøre en haug med If > Then-stilsetninger; langt unna den lovede LAM.
Hvis det er noe du kan ta fra Rabbits r1-enhet er, ja, visjonen er der. Arbeid må imidlertid gjøres før realisering, så ikke bli begeistret ennå.
Støtt vårt arbeid ❤️
Hvis du likte denne artikkelen, vurder å gi en tips for å hjelpe oss med å fortsette å publisere kvalitetsinnhold.




















