AGI und Zukunft der KI
Inflection-2.5: Das Leistungsmodell, das GPT-4 und Gemini herausfordert
Inflection AI hat mit der jüngsten Enthüllung von Inflection-2.5, einem Modell, das mit den führenden LLMs (Large Language Models) der Welt, einschließlich OpenAI’s GPT-4 und Google’s Gemini, konkurriert, Wellen in dem Bereich der großen Sprachmodelle gemacht.
Der rasante Aufstieg von Inflection AI wurde durch eine massive 1,3-Milliarden-Dollar-Finanzierungsrunde weiter angeheizt, die von Branchenriesen wie Microsoft (MSFT ), NVIDIA (NVDA ) und renommierten Investoren wie Reid Hoffman, Bill Gates und Eric Schmidt geleitet wurde. Diese erhebliche Investition bringt die Gesamtfinanzierung, die das Unternehmen aufgebracht hat, auf 1,525 Milliarden Dollar.
In Zusammenarbeit mit den Partnern CoreWeave (CRWV ) und NVIDIA baut Inflection AI den größten AI-Cluster der Welt auf, der aus einer beispiellosen Anzahl von 22.000 NVIDIA H100 Tensor Core GPUs besteht. Diese enorme Rechenleistung wird die Schulung und Bereitstellung einer neuen Generation von groß angelegten KI-Modellen unterstützen und es Inflection AI ermöglichen, die Grenzen dessen zu erweitern, was im Bereich der persönlichen KI möglich ist.
Die bahnbrechende Arbeit des Unternehmens hat bereits bemerkenswerte Ergebnisse erbracht, mit dem Inflection-AI-Cluster, der derzeit aus über 3.500 NVIDIA H100 Tensor Core GPUs besteht und auf dem Open-Source-Benchmark MLPerf Spitzenleistungen erbringt. In einer gemeinsamen Einreichung mit CoreWeave und NVIDIA hat der Cluster den Referenztrainingsauftrag für große Sprachmodelle in nur 11 Minuten abgeschlossen und damit seine Position als schnellster Cluster in diesem Benchmark festgelegt.
Diese Leistung folgt der Enthüllung von Inflection-1, dem internen großen Sprachmodell (LLM) von Inflection AI, das als bestes Modell in seiner Rechenklasse gefeiert wird. Indem es Branchenriesen wie GPT-3.5, LLaMA, Chinchilla und PaLM-540B auf einer Vielzahl von Benchmarks, die häufig für den Vergleich von LLMs verwendet werden, übertrifft, ermöglicht Inflection-1 es den Benutzern, mit Pi, dem persönlichen KI-Assistenten von Inflection AI, auf einfache und natürliche Weise zu interagieren und schnelle, relevante und hilfreiche Informationen und Ratschläge zu erhalten.
Die Verpflichtung von Inflection AI zu Transparenz und Reproduzierbarkeit zeigt sich in der Veröffentlichung einer technischen Mitteilung, in der die Bewertung und Leistung von Inflection-1 auf verschiedenen Benchmarks detailliert dargestellt werden. Die Mitteilung offenbart, dass Inflection-1 Modelle in der gleichen Rechenklasse übertrifft, die als Modelle definiert sind, die mit höchstens den FLOPs (Floating-Point-Operationen) von PaLM-540B trainiert wurden.
Der Erfolg von Inflection-1 und die schnelle Skalierung der Recheninfrastruktur des Unternehmens, die durch die erhebliche Finanzierungsrunde angeheizt wurde, unterstreichen die unerschütterliche Hingabe von Inflection AI, seine Mission, eine persönliche KI für jeden zu schaffen, zu erfüllen. Durch die Integration von Inflection-1 in Pi können die Benutzer nun die Macht einer persönlichen KI erleben und von ihrer empathischen Persönlichkeit, Nützlichkeit und Sicherheitsstandards profitieren.
Inflection-2.5
Inflection-2.5 ist jetzt für alle Benutzer von Pi, dem persönlichen KI-Assistenten von Inflection AI, auf mehreren Plattformen verfügbar, einschließlich Web (pi.ai), iOS, Android und einer neuen Desktop-App. Diese Integration markiert einen bedeutenden Meilenstein in der Mission von Inflection AI, eine persönliche KI für jeden zu schaffen, indem sie rohe Fähigkeiten mit ihrer Signaturempathie und Sicherheitsstandards kombiniert.
Ein Sprung in der Leistung Das vorherige Modell von Inflection AI, Inflection-1, nutzte etwa 4 % der Trainings-FLOPs (Floating-Point-Operationen) von GPT-4 und zeigte eine durchschnittliche Leistung von etwa 72 % im Vergleich zu GPT-4 bei verschiedenen IQ-orientierten Aufgaben. Mit Inflection-2.5 hat Inflection AI einen erheblichen Schub in der intellektuellen Fähigkeit von Pi erzielt, mit einem Fokus auf Codierung und Mathematik.
Die Leistung des Modells auf wichtigen Branchenbenchmarks zeigt seine Stärke, indem es über 94 % der durchschnittlichen Leistung von GPT-4 bei verschiedenen Aufgaben zeigt, mit einem besonderen Schwerpunkt auf die Überlegenheit in den STEM-Bereichen. Diese bemerkenswerte Leistung ist ein Zeichen für die Verpflichtung von Inflection AI, die technologische Grenze zu erweitern, während sie gleichzeitig einen unerschütterlichen Fokus auf Benutzererfahrung und Sicherheit beibehält.
Codierung und Mathematik Die Stärke von Inflection-2.5 zeigt sich in der Codierung und Mathematik, indem es eine über 10%ige Verbesserung gegenüber Inflection-1 auf BIG-Bench-Hard, einem Teilbereich von Herausforderungen für große Sprachmodelle, zeigt. Zwei Codierungsbenchmarks, MBPP+ und HumanEval+, zeigen massive Verbesserungen gegenüber Inflection-1, was Inflection-2.5 als eine Kraft zu beachten in der Codierungsdomäne festigt.
Im MBPP+-Benchmark übertrifft Inflection-2.5 seinen Vorgänger um ein erhebliches Maß, indem es ein Leistungsniveau zeigt, das mit dem von GPT-4 vergleichbar ist, wie von DeepSeek Coder berichtet. Ähnlich zeigt Inflection-2.5 im HumanEval+-Benchmark bemerkenswerte Fortschritte, indem es die Leistung von Inflection-1 übertrifft und sich dem Niveau von GPT-4 nähert, wie auf dem EvalPlus-Leaderboard berichtet.
Branchenbenchmark-Dominanz
Inflection-2.5 ragt in Branchenbenchmarks hervor, indem es erhebliche Verbesserungen gegenüber Inflection-1 auf dem MMLU-Benchmark und dem GPQA-Diamant-Benchmark zeigt, der für seine Experten-Schwierigkeit bekannt ist. Die Leistung des Modells auf diesen Benchmarks unterstreicht seine Fähigkeit, eine Vielzahl von Aufgaben zu bewältigen, von Aufgaben auf High-School-Niveau bis hin zu professionellen Herausforderungen.
Hervorragende Leistung in STEM-Prüfungen Die Stärke des Modells erstreckt sich auf STEM-Prüfungen, mit hervorragender Leistung auf der ungarischen Mathematikprüfung und der Physik-GRE. Auf der ungarischen Mathematikprüfung zeigt Inflection-2.5 seine mathematische Begabung, indem es den bereitgestellten Few-Shot-Prompt und die Formatierung nutzt, was eine einfache Reproduzierbarkeit ermöglicht.
Im Physik-GRE, einem Graduate-Eingangstest in Physik, erreicht Inflection-2.5 das 85. Perzentil der menschlichen Testteilnehmer bei maj@8 (Mehrheitsentscheid bei 8), was seine Position als ein formidabler Konkurrent im Bereich der Physikproblemlösung festigt. Darüber hinaus nähert sich das Modell der Spitzenleistung bei maj@32, indem es seine Fähigkeit unter Beweis stellt, komplexe Physikprobleme mit bemerkenswerter Genauigkeit zu lösen.
Verbesserung der Benutzererfahrung Inflection-2.5 hält nicht nur die Signaturempathie und Sicherheitsstandards von Pi aufrecht, sondern erhöht auch seinen Status als vielseitiger und unschätzbarer persönlicher KI-Assistent in verschiedenen Themen. Von der Diskussion über aktuelle Ereignisse bis hin zur Suche nach lokalen Empfehlungen, dem Studium für Prüfungen, der Codierung und sogar lockeren Gesprächen verspricht Pi mit Inflection-2.5 eine bereicherte Benutzererfahrung.
Mit den leistungsstarken Fähigkeiten von Inflection-2.5 interagieren die Benutzer mit Pi auf einem breiteren Themenspektrum als je zuvor. Die Fähigkeit des Modells, komplexe Aufgaben zu bewältigen, kombiniert mit seiner empathischen Persönlichkeit und Echtzeit-Websuchfunktion, stellt sicher, dass die Benutzer hochwertige, aktuelle Informationen und Anleitungen erhalten.
Benutzerakzeptanz und -bindung Der Einfluss der Integration von Inflection-2.5 in Pi ist bereits in den Benutzersentiment-, Engagement- und Bindungsmaßen erkennbar. Inflection AI hat eine erhebliche Beschleunigung des organischen Benutzerwachstums erlebt, mit einer Million täglicher und sechs Millionen monatlicher aktiver Benutzer, die über vier Milliarden Nachrichten mit Pi austauschen.
Im Durchschnitt dauern Gespräche mit Pi 33 Minuten, wobei eines von zehn über eine Stunde pro Tag dauert. Darüber hinaus kehren etwa 60 % der Menschen, die in einer bestimmten Woche mit Pi interagieren, in der folgenden Woche zurück, was eine höhere monatliche Bindung als bei führenden Wettbewerbern in der Branche zeigt.
Technische Details und Benchmark-Transparenz
Im Einklang mit der Verpflichtung von Inflection AI zu Transparenz und Reproduzierbarkeit hat das Unternehmen umfassende technische Ergebnisse und Details zur Leistung von Inflection-2.5 auf verschiedenen Branchenbenchmarks bereitgestellt.
Zum Beispiel zeigt Inflection-2.5 auf der korrigierten Version des MT-Bench-Datensatzes, der Probleme mit fehlerhaften Referenzlösungen und fehlerhaften Prämissen im ursprünglichen Datensatz anspricht, eine Leistung, die den Erwartungen aufgrund anderer Benchmarks entspricht.
Inflection AI hat Inflection-2.5 auch auf HellaSwag und ARC-C ausgewertet, gemeinsame Sinnes- und Wissenschaftsbenchmarks, die von einer Vielzahl von Modellen berichtet werden, und die Ergebnisse zeigen eine starke Leistung auf diesen sättigenden Benchmarks.
Es ist wichtig zu beachten, dass die bereitgestellten Bewertungen den Modell-Modus von Pi darstellen, die Benutzererfahrung kann jedoch aufgrund von Faktoren wie der Auswirkung der Websuche (die in den Benchmarks nicht verwendet wird), der Struktur der Few-Shot-Prompting und anderer produktionsseitiger Unterschiede leicht variieren.
Schlussfolgerung
Inflection-2.5 stellt einen bedeutenden Schritt nach vorne in dem Bereich der großen Sprachmodelle dar, indem es die Fähigkeiten von Branchenführern wie GPT-4 und Gemini bei nur einem Bruchteil der Rechenressourcen in den Schatten stellt. Mit seiner beeindruckenden Leistung auf einer Vielzahl von Benchmarks, insbesondere in den STEM-Bereichen, der Codierung und der Mathematik, hat Inflection-2.5 sich als ein formidabler Konkurrent im KI-Landschaft etabliert.
Die Integration von Inflection-2.5 in Pi, den persönlichen KI-Assistenten von Inflection AI, verspricht eine bereicherte Benutzererfahrung, indem es rohe Fähigkeiten mit empathischer Persönlichkeit und Sicherheitsstandards kombiniert. Während Inflection AI weiterhin die Grenzen dessen erweitert, was mit LLMs möglich ist, erwartet die KI-Gemeinschaft gespannt die nächste Welle von Innovationen und Durchbrüchen von diesem bahnbrechenden Unternehmen.














