AGI og fremtidens AI
Inflection-2.5: Den kraftfulde LLM, der udfordrer GPT-4 og Gemini
Inflection AI har skabt bølger i feltet af store sprogmodeller (LLM’er) med deres nylige præsentation af Inflection-2.5, en model, der kan konkurrere med verdens førende LLM’er, herunder OpenAI’s GPT-4 og Google’s Gemini.
Inflection AI’s hurtige opstigning er yderligere fremmet af en massiv $1,3 milliards investeringsrunde, ledet af branchegiganter som Microsoft (MSFT ), NVIDIA (NVDA ) og anerkendte investorer, herunder Reid Hoffman, Bill Gates og Eric Schmidt. Denne betydelige investering bringer den samlede funding, som virksomheden har samlet, op på $1,525 milliarder.
I samarbejde med partnere som CoreWeave (CRWV ) og NVIDIA bygger Inflection AI verdens største AI-cluster, der består af en uhørt 22.000 NVIDIA H100 Tensor Core GPU’er. Denne kolossale beregningskraft vil understøtte træning og implementering af en ny generation af store skalamodeller, der vil enable Inflection AI til at udvide grænserne for, hvad der er muligt i feltet af personlig AI.
Virksomhedens banebrydende arbejde har allerede resulteret i bemærkelsesværdige resultater, med Inflection AI-clusteret, der i øjeblikket består af over 3.500 NVIDIA H100 Tensor Core GPU’er, der leverer state-of-the-art-præstation på den open-source-benchmark MLPerf. I en fælles indsendelse med CoreWeave og NVIDIA gennemførte clusteret reference-træningsopgaven for store sprogmodeller på kun 11 minutter, hvilket fastsætter dets position som den hurtigste cluster på denne benchmark.
Dette opnåelse følger præsentationen af Inflection-1, Inflection AI’s interne store sprogmodel (LLM), der er blevet hyldet som den bedste model i sin compute-klasse. Ved at overgå branchegiganter som GPT-3.5, LLaMA, Chinchilla og PaLM-540B på en bred vifte af benchmarks, der normalt bruges til at sammenligne LLM’er, giver Inflection-1 brugerne mulighed for at interagere med Pi, Inflection AI’s personlige AI, på en simpel og naturlig måde, hvor de modtager hurtig, relevant og nyttig information og råd.
Inflection AI’s engagement i gennemsigtighed og reproducerbarhed er tydeligt i udgivelsen af en teknisk memo, der detaljerer evaluering og præstation af Inflection-1 på forskellige benchmarks. Memoen afslører, at Inflection-1 overgår modeller i samme compute-klasse, defineret som modeller, der er trænet ved hjælp af højst FLOPs (floating-point operationer) af PaLM-540B.
Succesen med Inflection-1 og den hurtige opskalering af virksomhedens beregningsinfrastruktur, fremmet af den betydelige investeringsrunde, understreger Inflection AI’s urokkelige engagement i at levere på sin mission om at skabe en personlig AI til alle. Med integrationen af Inflection-1 i Pi kan brugerne nu opleve kraften af en personlig AI, der nyder godt af dens empatiske personlighed, nyttighed og sikkerhedsstandarder.
Inflection-2.5
Inflection-2.5 er nu tilgængelig for alle brugere af Pi, Inflection AI’s personlige AI-assistent, på tværs af multiple platforme, herunder web (pi.ai), iOS, Android og en ny desktop-app. Denne integration markerer en betydelig milepæl i Inflection AI’s mission om at skabe en personlig AI til alle, kombinerer rå kapacitet med deres signatur-empatiske personlighed og sikkerhedsstandarder.
Et spring i præstation Inflection AI’s forrige model, Inflection-1, anvendte ca. 4% af trænings-FLOPs (floating-point operationer) af GPT-4 og viste en gennemsnitlig præstation på ca. 72% i forhold til GPT-4 på tværs af forskellige IQ-orienterede opgaver. Med Inflection-2.5 har Inflection AI opnået en betydelig forbedring af Pi’s intellektuelle kapaciteter, med fokus på kodning og matematik.
Modellens præstation på nøgleindustri-benchmarks demonstrerer dens dygtighed, hvor den viser over 94% af GPT-4’s gennemsnitlige præstation på tværs af forskellige opgaver, med en særlig vægt på at udmærke sig i STEM-områder. Dette bemærkelsesværdige opnåelse er en bekræftelse af Inflection AI’s engagement i at udvide teknologiens grænser, samtidig med at man fastholder fokus på brugeroplevelse og sikkerhed.
Kodning og matematik-dygtighed Inflection-2.5 udmærker sig i kodning og matematik, hvor den viser en forbedring på over 10% i forhold til Inflection-1 på BIG-Bench-Hard, en undergruppe af udfordrende problemer for store sprogmodeller. To kodnings-benchmarks, MBPP+ og HumanEval+, afslører massive forbedringer i forhold til Inflection-1, hvilket fastsætter Inflection-2.5’s position som en kraft at regne med i kodningsdomænet.
På MBPP+-benchmarket overgår Inflection-2.5 sin forgænger med en betydelig margin, hvor den viser en præstation på niveau med GPT-4, som rapporteret af DeepSeek Coder. Ligesom på HumanEval+-benchmarket viser Inflection-2.5 bemærkelsesværdig fremgang, hvor den overgår Inflection-1’s præstation og nærmer sig GPT-4’s niveau, som rapporteret på EvalPlus-leaderboardet.
Industri-benchmark-dominans
Inflection-2.5 udmærker sig i industribenchmarks, hvor den viser betydelige forbedringer i forhold til Inflection-1 på MMLU-benchmarket og GPQA Diamond-benchmarket, der er kendt for sin ekspertniveau-sværhedsgrad. Modellens præstation på disse benchmarks understreger dens evne til at håndtere en bred vifte af opgaver, fra high school-niveau-problemer til professionelle udfordringer.
Udmærkelse i STEM-eksaminationer Modellens dygtighed strækker sig til STEM-eksaminationer, hvor den viser en bemærkelsesværdig præstation på den ungarske matematik-eksamen og Physics GRE. På den ungarske matematik-eksamen viser Inflection-2.5 sin matematiske dygtighed ved at udnytte den tilgængelige few-shot-prompt og formatering, hvilket muliggør let reproducerbarhed.
I Physics GRE, en graduate-entrance-eksamen i fysik, når Inflection-2.5 85. percentilen af menneskelige testdeltagere i maj@8 (majority-vote på 8), hvilket fastsætter dens position som en formidabel modstander i fysik-problemløsning. Yderligere nærmer modellen sig toppen af scoren i maj@32, hvor den viser sin evne til at tackle komplekse fysik-problemer med bemærkelsesværdig præcision.
Forbedring af brugeroplevelsen Inflection-2.5 opretholder ikke kun Pi’s signatur-personlighed og sikkerhedsstandarder, men hæver også dens status som en alsidig og uvurderlig personlig AI på tværs af diverse emner. Fra diskussion af aktuelle begivenheder til at søge lokale anbefalinger, studere til eksamen, kodning og endda uformelle samtaler, lover Pi, drevet af Inflection-2.5, en forbedret brugeroplevelse.
Med Inflection-2.5’s kraftfulde kapaciteter interagerer brugerne med Pi på en bredere vifte af emner end nogensinde før. Modellens evne til at håndtere komplekse opgaver, kombineret med dens empatiske personlighed og realtids-web-søgefunktioner, sikrer, at brugerne modtager højkvalitets-, opdateret information og vejledning.
Bruger-adopterings- og engagement-data Effekten af Inflection-2.5’s integration i Pi er allerede tydelig i bruger-sentiment-, engagement- og retentions-målinger. Inflection AI har oplevet en betydelig acceleration i organisk bruger-vækst, hvor en million daglige og seks millioner månedlige aktive brugere udveksler mere end fire milliarder meddelelser med Pi.
I gennemsnit varer samtaler med Pi 33 minutter, hvoraf en ud af ti varer over en time hver dag. Yderligere returnerer ca. 60% af personer, der interagerer med Pi i en given uge, den følgende uge, hvilket viser en højere månedlig fastholdelse end førende konkurrenter i feltet.
Tekniske detaljer og benchmark-gennemsigtighed
I overensstemmelse med Inflection AI’s engagement i gennemsigtighed og reproducerbarhed har virksomheden udgivet omfattende tekniske resultater og detaljer om Inflection-2.5’s præstation på forskellige industribenchmarks.
For eksempel viser Inflection-2.5 på den korrekte version af MT-Bench-datasættet, der adresserer problemer med forkerte referencesolutioner og fejlbehæftede præmisser i den originale datasæt, en præstation, der er i overensstemmelse med forventninger baseret på andre benchmarks.
Inflection AI har også evaluaret Inflection-2.5 på HellaSwag og ARC-C, fælles forstand og videnskabsbenchmarks, der rapporteres af en bred vifte af modeller, og resultaterne viser en stærk præstation på disse mættende benchmarks.
Det er vigtigt at bemærke, at mens de evalueringer, der er tilgængelige, repræsenterer modellen, der driver Pi, kan brugeroplevelsen variere lidt på grund af faktorer som effekten af web-hentning (ikke brugt i benchmarks), strukturen af few-shot-prompting og andre produktionsforskelle.
Konklusion
Inflection-2.5 repræsenterer et betydeligt spring fremad i feltet af store sprogmodeller, der udfordrer industriansigter som GPT-4 og Gemini, mens den kun anvender en brøkdel af beregningsressourcerne. Med dens imponerende præstation på tværs af en bred vifte af benchmarks, især i STEM-områder, kodning og matematik, har Inflection-2.5 positioneret sig som en formidabel modstander i AI-landskabet.
Integrationen af Inflection-2.5 i Pi, Inflection AI’s personlige AI-assistent, lover en forbedret brugeroplevelse, der kombinerer rå kapacitet med empatiske personlighed og sikkerhedsstandarder. Mens Inflection AI fortsætter med at udvide grænserne for, hvad der er muligt med LLM’er, venter AI-fællesskabet ivrigt den næste bølge af innovationer og gennembrud fra dette banebrydende selskab.














