AGI og fremtidens AI

Inflection-2.5: Den kraftfulle LLM-rivalen til GPT-4 og Gemini

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Inflection AI har vært i fokus i feltet store språkmodeller (LLM) med deres nylige lansering av Inflection-2.5, en modell som konkurrerer med verdens ledende LLM, inkludert OpenAI’s GPT-4 og Google’s Gemini.

Inflection AI’s raske vekst har blitt ytterligere fremmet av en massiv 1,3 milliarder dollar investeringsrunde, ledet av bransje-giganter som Microsoft (MSFT ), NVIDIA (NVDA ) og kjente investorer som Reid Hoffman, Bill Gates og Eric Schmidt. Denne betydelige investeringen bringer det totale beløpet som er investert i selskapet til 1,525 milliarder dollar.

I samarbeid med partnere CoreWeave (CRWV ) og NVIDIA, bygger Inflection AI verdens største AI-kluster, bestående av en utenkelig 22 000 NVIDIA H100 Tensor Core GPU-er. Denne kolossale datamaskinkraften vil støtte opplæring og distribusjon av en ny generasjon store AI-modeller, og muliggjøre at Inflection AI kan utvide grensene for hva som er mulig i feltet personlig AI.

Selskapets banebrytende arbeid har allerede gitt bemerkelsesverdige resultater, med Inflection AI-klustret, som for øyeblikket består av over 3 500 NVIDIA H100 Tensor Core GPU-er, og som leverer toppkvalitet på den åpne benchmarken MLPerf. I en felles innsending med CoreWeave og NVIDIA, fullførte klustret referanseplassen for store språkmodeller på bare 11 minutter, og solidifiserte sin posisjon som den raskeste klustret på denne benchmarken.

Dette fremgangen følger lanseringen av Inflection-1, Inflection AI’s egen store språkmodell (LLM), som har blitt rost som den beste modellen i sin klasse. Den overgår industrikjempene som GPT-3.5, LLaMA, Chinchilla og PaLM-540B på en rekke benchmark-tester som vanligvis brukes til å sammenligne LLM, og Inflection-1 muliggjør at brukerne kan samhandle med Pi, Inflection AI’s personlige AI, på en enkel og naturlig måte, og motta rask, relevant og nyttig informasjon og råd.

Inflection AI’s forpliktelse til åpenhet og reproduserbarhet er tydelig i utgivelsen av en teknisk memo som detaljerer evaluering og ytelse av Inflection-1 på ulike benchmark-tester. Memoen avslører at Inflection-1 overgår modeller i samme klasse, definert som modeller som er trent med maksimalt FLOPs (flytende punkt-operasjoner) som PaLM-540B.

Suksessen med Inflection-1 og den raske skalingen av selskapets datamaskin-infrastruktur, drevet av den betydelige investeringsrunden, understreker Inflection AI’s urokkelige forpliktelse til å levere på sin misjon om å skape en personlig AI for alle. Med integreringen av Inflection-1 i Pi, kan brukerne nå oppleve kraften av en personlig AI, og nyte godt av dens empatisk personlighet, nytte og sikkerhetsstandarder.

Inflection-2.5

Inflection-2.5 er nå tilgjengelig for alle brukere av Pi, Inflection AI’s personlige AI-assistent, på flere plattformer, inkludert web (pi.ai), iOS, Android og en ny desktop-app. Denne integreringen markerer en betydelig milepæl i Inflection AI’s misjon om å skape en personlig AI for alle, og kombinerer rå kapasitet med deres signatur-empatisk personlighet og sikkerhetsstandarder.

Et sprang i ytelse Inflection AI’s forrige modell, Inflection-1, brukte omtrent 4 % av trening-FLOPs (flytende punkt-operasjoner) av GPT-4 og viste en gjennomsnittlig ytelse på rundt 72 % sammenlignet med GPT-4 på ulike IQ-orienterte oppgaver. Med Inflection-2.5 har Inflection AI oppnådd en betydelig forbedring av Pi’s intellektuelle evner, med fokus på kode og matematikk.

Modellens ytelse på nøkkelindustri-benchmark-tester demonstrerer dens dyktighet, og viser over 94 % av GPT-4’s gjennomsnittlige ytelse på ulike oppgaver, med en spesiell vekt på å utmerke seg i STEM-områder. Dette bemerkelsesverdige fremgangen er et vitnesbyrd om Inflection AI’s forpliktelse til å utvide teknologiens grenser, samtidig som de opprettholder fokus på brukeropplevelse og sikkerhet.

Kode og matematisk dyktighet Inflection-2.5 utmerker seg i kode og matematikk, og viser en forbedring på over 10 % sammenlignet med Inflection-1 på BIG-Bench-Hard, en undergruppe av utfordrende problemer for store språkmodeller. To kode-benchmark-tester, MBPP+ og HumanEval+, avslører massive forbedringer sammenlignet med Inflection-1, og solidifiserer Inflection-2.5’s posisjon som en kraft å regne med i kode-domenet.

På MBPP+-benchmark-testen overgår Inflection-2.5 sin forgjenger med en betydelig margin, og viser en ytelse på et nivå som er sammenlignbart med GPT-4, som rapportert av DeepSeek Coder. Liksom på HumanEval+-benchmark-testen, viser Inflection-2.5 bemerkelsesverdige fremganger, og overgår Inflection-1 og nærmer seg GPT-4’s nivå, som rapportert på EvalPlus-leaderboardet.

Industri-benchmark-dominans

Inflection-2.5 utmerker seg på industribenchmark-tester, og viser betydelige forbedringer sammenlignet med Inflection-1 på MMLU-benchmark-testen og GPQA Diamond-benchmark-testen, som er kjent for sin ekspert-nivå vanskelighet. Modellens ytelse på disse benchmark-testene understreker dens evne til å håndtere en rekke oppgaver, fra high school-nivå til profesjonell-nivå utfordringer.

Utmerker seg i STEM-eksamener Modellens dyktighet strekker seg til STEM-eksamener, og viser en fremragende ytelse på den ungarske matematikk-eksamen og Physics GRE. På den ungarske matematikk-eksamen viser Inflection-2.5 sin matematiske dyktighet ved å utnytte den tilgjengelige few-shot-prompten og formateringen, og muliggjør enkel reproduksjon.

På Physics GRE, en graduate-inngangseksamen i fysikk, når Inflection-2.5 85. percentil av menneskelige test-takere i maj@8 (majoritetsstemme på 8), og solidifiserer sin posisjon som en formidabel konkurrent i fysikk-problem-løsning. Videre nærmer modellen topp-scoringen på maj@32, og viser sin evne til å håndtere komplekse fysikk-problemer med bemerkelsesverdig nøyaktighet.

Forbedrer brukeropplevelsen Inflection-2.5 opprettholder ikke bare Pi’s signatur-empatisk personlighet og sikkerhetsstandarder, men løfter også sin status som en allsidig og uvurderlig personlig AI på tvers av ulike emner. Fra å diskutere aktuelle hendelser til å søke lokale anbefalinger, studere for eksamener, kode og selv uformelle samtaler, lover Pi, drevet av Inflection-2.5, en forbedret brukeropplevelse.

Med Inflection-2.5’s kraftfulle evner, samhandler brukerne med Pi på en bredere rekke av emner enn noensinne før. Modellens evne til å håndtere komplekse oppgaver, kombinert med dens empatisk personlighet og sanntids-nettsøk-evner, sikrer at brukerne mottar høykvalitets-, oppdatert informasjon og veiledning.

Bruker-tilpasning og engasjement Effekten av Inflection-2.5’s integrering i Pi er allerede tydelig i bruker-sentiment, engasjement og gjenværende metrikker. Inflection AI har vært vitne til en betydelig akselerasjon i organisk bruker-vekst, med en million daglige og seks millioner månedlige aktive brukere som utveksler over fire milliarder meldinger med Pi.

I gjennomsnitt varer samtaler med Pi i 33 minutter, og en av ti varer over en time hver dag. Videre returnerer omtrent 60 % av personene som samhandler med Pi i en gitt uke tilbake uken etter, og viser en høyere månedlig “stickiness” enn ledende konkurrenter i bransjen.

Tekniske detaljer og benchmark-gjennomsiktighet

I tråd med Inflection AI’s forpliktelse til åpenhet og reproduserbarhet, har selskapet levert omfattende tekniske resultater og detaljer om ytelsen til Inflection-2.5 på ulike industribenchmark-tester.

For eksempel, på den korrigerte versjonen av MT-Bench-datasettet, som adresserer problemer med feil referansepunkter og feilaktige premisser i det originale datasettet, viser Inflection-2.5 en ytelse som er i tråd med forventningene basert på andre benchmark-tester.

Inflection AI har også evaluert Inflection-2.5 på HellaSwag og ARC-C, som er vanlige benchmark-tester for sunn fornuft og vitenskap, og resultater viser en sterk ytelse på disse metrikkene.

Det er viktig å merke seg at mens evalueringene som er levert representerer modellen som driver Pi, kan brukeropplevelsen variere noe på grunn av faktorer som påvirkningen av nett-søk (ikke brukt i benchmark-testene), strukturen til few-shot-prompting og andre produksjons-siden forskjeller.

Konklusjon

Inflection-2.5 representerer et betydelig sprang fremover i feltet store språkmodeller, og konkurrerer med industrikjempene som GPT-4 og Gemini, samtidig som den kun bruker en brøkdel av datamaskin-resursene. Med sin imponerende ytelse på en rekke benchmark-tester, spesielt i STEM-områder, kode og matematikk, har Inflection-2.5 posisjonert seg som en formidabel konkurrent i AI-landskapet.

Integreringen av Inflection-2.5 i Pi, Inflection AI’s personlige AI-assistent, lover en forbedret brukeropplevelse, og kombinerer rå kapasitet med empatisk personlighet og sikkerhetsstandarder. Mens Inflection AI fortsetter å utvide grensene for hva som er mulig med LLM, ser AI-samfunnet frem til den neste bølgen av innovasjoner og gjennombrudd fra dette banebrytende selskapet.

Jeg har brukt de siste fem årene på å dykke ned i den fasiniserende verden av Maskinlæring og Dypt Læring. Min lidenskap og ekspertise har ledet meg til å bidra til over 50 ulike programvareprosjekter, med særlig fokus på AI/ML. Min pågående nysgjørhet har også trukket meg mot Naturlig Språkbehandling, et felt jeg er ivrig etter å utforske videre.