AGI och framtidens AI

Inflection-2.5: Den kraftfulla LLM som utmanar GPT-4 och Gemini

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Inflection AI har skapat rubriker inom området stora språkmodeller (LLM) med sin nyliga presentation av Inflection-2.5, en modell som konkurrerar med världens ledande LLM, inklusive OpenAI’s GPT-4 och Google’s Gemini.

Inflection AI’s snabba tillväxt har ytterligare accelererats av en massiv 1,3 miljarder dollar i finansiering, ledd av branschjättar som Microsoft (MSFT ), NVIDIA (NVDA ) och kända investerare som Reid Hoffman, Bill Gates och Eric Schmidt. Denna betydande investering bringar det totala kapitalet som bolaget har samlat in till 1,525 miljarder dollar.

I samarbete med partners som CoreWeave (CRWV ) och NVIDIA bygger Inflection AI världens största AI-kluster, bestående av en utanför denna värld 22 000 NVIDIA H100 Tensor Core GPU:er. Denna kolossala beräkningskraft kommer att stödja utbildning och distribution av en ny generation storskaliga AI-modeller, vilket möjliggör för Inflection AI att utvidga gränserna för vad som är möjligt inom personlig AI.

Företagets banbrytande arbete har redan gett anmärkningsvärda resultat, med Inflection AI-klustret, som för närvarande består av över 3 500 NVIDIA H100 Tensor Core GPU:er, som uppnår toppmoderna prestationer på den öppna benchmarken MLPerf. I ett gemensamt bidrag med CoreWeave och NVIDIA slutförde klustret referensutbildningsuppgiften för stora språkmodeller på bara 11 minuter, vilket befäster dess position som det snabbaste klustret på denna benchmark.

Denna prestation följer presentationen av Inflection-1, Inflection AI:s egen stora språkmodell (LLM), som har hyllats som den bästa modellen i sin beräkningsklass. Inflection-1 överträffar branschjättar som GPT-3.5, LLaMA, Chinchilla och PaLM-540B på en mängd olika benchmarkar som vanligtvis används för att jämföra LLM, och möjliggör för användare att interagera med Pi, Inflection AI:s personliga AI, på ett enkelt och naturligt sätt, och få snabb, relevant och användbar information och råd.

Inflection AI:s åtagande för transparens och reproducerbarhet är tydligt i utgivningen av en teknisk promemoria som detaljerar utvärdering och prestanda av Inflection-1 på olika benchmarkar. Promemorian visar att Inflection-1 överträffar modeller i samma beräkningsklass, definierad som modeller som tränats med högst FLOPs (flyttalsoperationer) av PaLM-540B.

Inflection-1:s och det snabba skalningsföretaget för företagets beräkningsinfrastruktur, som drivs av den betydande finansieringsrundan, understryker Inflection AI:s outtröttliga engagemang för att uppfylla sin vision om att skapa en personlig AI för alla. Med integrationen av Inflection-1 i Pi kan användare nu uppleva kraften av en personlig AI, som har en empatisk personlighet, användbarhet och säkerhetsstandarder.

Inflection-2.5

Inflection-2.5 är nu tillgänglig för alla användare av Pi, Inflection AI:s personliga AI-assistent, på flera plattformar, inklusive webben (pi.ai), iOS, Android och en ny desktop-app. Denna integration markerar en betydande milstolpe i Inflection AI:s vision att skapa en personlig AI för alla, som kombinerar rå kapacitet med sin signatur empatiska personlighet och säkerhetsstandarder.

Ett språng i prestanda Inflection AI:s tidigare modell, Inflection-1, använde cirka 4 % av utbildnings-FLOPs (flyttalsoperationer) av GPT-4 och visade en genomsnittlig prestanda på cirka 72 % jämfört med GPT-4 på olika IQ-orienterade uppgifter. Med Inflection-2.5 har Inflection AI uppnått en betydande förbättring av Pi:s intellektuella förmågor, med fokus på kodning och matematik.

Modellens prestanda på viktiga branschbenchmarkar visar dess duglighet, med över 94 % av GPT-4:s genomsnittliga prestanda på olika uppgifter, med särskild tonvikt på att excellera inom STEM-områden. Denna anmärkningsvärda prestation är ett bevis på Inflection AI:s engagemang för att driva den teknologiska gränsen samtidigt som man upprätthåller en outtröttlig fokus på användarupplevelse och säkerhet.

Kodning och matematik duglighet Inflection-2.5 utmärker sig inom kodning och matematik, med en förbättring på över 10 % jämfört med Inflection-1 på BIG-Bench-Hard, en delmängd av utmanande problem för stora språkmodeller. Två kodningsbenchmarkar, MBPP+ och HumanEval+, visar betydande förbättringar jämfört med Inflection-1, vilket befäster Inflection-2.5:s position som en kraft att räkna med inom kodningsdomänen.

På MBPP+-benchmarken överträffar Inflection-2.5 sin föregångare med en betydande marginal, med en prestandanivå jämförbar med den hos GPT-4, enligt DeepSeek Coder. Likaså på HumanEval+-benchmarken visar Inflection-2.5 en anmärkningsvärd framsteg, överträffande Inflection-1 och närmande sig nivån hos GPT-4, enligt EvalPlus-ledaren.

Branschbenchmark dominans

Inflection-2.5 utmärker sig på branschbenchmarkar, med betydande förbättringar jämfört med Inflection-1 på MMLU-benchmarken och GPQA Diamond-benchmarken, som är känd för sin expertnivåsvårighet. Modellens prestanda på dessa benchmarkar understryker dess förmåga att hantera en mängd olika uppgifter, från gymnasienivå till professionell nivå.

Excellerar inom STEM-examina Modellens duglighet sträcker sig till STEM-examina, med en utmärkt prestanda på den ungerska matematikexamen och fysik GRE. På den ungerska matematikexamen visar Inflection-2.5 sin matematiska duglighet genom att utnyttja den tillhandahållna few-shot-prompten och formateringen, vilket möjliggör enkel reproducerbarhet.

I fysik GRE, en graduate-entréexamen i fysik, når Inflection-2.5 85:e percentilen av mänskliga testtagare i maj@8 (majoritetsröstning vid 8), vilket befäster dess position som en formidabel utmanare inom fysikproblemlösning. Dessutom närmar sig modellen toppbetyget i maj@32, vilket visar dess förmåga att hantera komplexa fysikproblem med anmärkningsvärd noggrannhet.

Förbättring av användarupplevelsen Inflection-2.5 upprätthåller inte bara Pi:s signaturpersonlighet och säkerhetsstandarder, utan höjer också dess status som en mångsidig och ovärderlig personlig AI inom en mängd olika ämnen. Från diskussioner om aktuella händelser till lokala rekommendationer, studier för examina, kodning och till och med informella samtal, lovar Pi, som drivs av Inflection-2.5, en förbättrad användarupplevelse.

Med Inflection-2.5:s kraftfulla förmågor interagerar användare med Pi på en bredare mängd ämnen än någonsin tidigare. Modellens förmåga att hantera komplexa uppgifter, kombinerat med dess empatiska personlighet och realtidswebbsökning, säkerställer att användare får högkvalitativ, uppdaterad information och vägledning.

Användarantagande och engagemang Inflection-2.5:s integration i Pi har redan visat sig i användarsentiment, engagemang och retentionsmått. Inflection AI har vittnat om en betydande acceleration i organisk användartillväxt, med en miljon dagliga och sex miljoner månatliga aktiva användare som utbyter över fyra miljarder meddelanden med Pi.

I genomsnitt varar samtal med Pi i 33 minuter, med en på tio som varar över en timme varje dag. Dessutom återvänder cirka 60 % av personer som interagerar med Pi under en given vecka veckan därpå, vilket visar en högre månatlig kvarhållning än ledande konkurrenter inom branschen.

Tekniska detaljer och benchmarktransparens

I linje med Inflection AI:s åtagande för transparens och reproducerbarhet har företaget tillhandahållit omfattande tekniska resultat och detaljer om prestandan för Inflection-2.5 på olika branschbenchmarkar.

Till exempel visar Inflection-2.5 en prestanda i linje med förväntningarna baserat på andra benchmarkar på den korrigerade versionen av MT-Bench-datasetet, som åtgärdar problem med felaktiga referenslösningar och bristfälliga antaganden i det ursprungliga datasetet.

Inflection AI har också utvärderat Inflection-2.5 på HellaSwag och ARC-C, vanliga benchmarkar för sunt förnuft och vetenskap som rapporteras av en mängd olika modeller, och resultaten visar en stark prestanda på dessa mättande benchmarkar.

Det är viktigt att notera att medan utvärderingarna som tillhandahålls representerar modellen som driver Pi, kan användarupplevelsen variera något på grund av faktorer som påverkan av webbretrieval (inte används i benchmarkarna), strukturen för few-shot-promptning och andra produktionsspecifika skillnader.

Slutsats

Inflection-2.5 representerar ett betydande steg framåt inom området stora språkmodeller, som utmanar förmågor hos branschledare som GPT-4 och Gemini, samtidigt som den använder bara en bråkdel av beräkningsresurserna. Med sin imponerande prestanda på en mängd olika benchmarkar, särskilt inom STEM-områden, kodning och matematik, har Inflection-2.5 positionerat sig som en formidabel utmanare inom AI-landskapet.

Integrationen av Inflection-2.5 i Pi, Inflection AI:s personliga AI-assistent, lovar en förbättrad användarupplevelse, som kombinerar rå kapacitet med empatisk personlighet och säkerhetsstandarder. Medan Inflection AI fortsätter att driva gränserna för vad som är möjligt med LLM, ser AI-samhället fram emot den kommande vågen av innovationer och genombrott från detta banbrytande företag.

Inflection AI:s visionära tillvägagångssätt sträcker sig bortom enkel modellutveckling, eftersom företaget erkänner vikten av förträning och finjustering för att skapa högkvalitativa, säkra och användbara AI-upplevelser. Som ett vertikalt integrerat AI-studio hanterar Inflection AI hela processen internt, från datainmatning och modellkonstruktion till högpresterande infrastruktur.

Jag har tillbringat de senaste fem åren med att dyka djupt in i den fascinerande världen av Maskinlärning och Djupinlärning. Min passion och expertis har lett mig till att bidra till över 50 olika mjukvaruprojekt, med särskild fokus på AI/ML. Min pågående nyfikenhet har också lett mig mot Naturlig Språkbehandling, ett område som jag är angelägen om att utforska vidare.