AGI dan AI masa depan

Inflection-2.5: Mesin LLM yang Menyaingi GPT-4 dan Gemini

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Inflection AI telah membuat gelombang di bidang model bahasa besar (LLM) dengan pengumuman terbaru mereka tentang Inflection-2.5, model yang bersaing dengan LLM terkemuka dunia, termasuk GPT-4 dan Gemini dari Google.

Pertumbuhan Inflection AI yang cepat telah diperkuat oleh putaran pendanaan sebesar $1,3 miliar, dipimpin oleh raksasa industri seperti Microsoft (MSFT ), NVIDIA (NVDA ), dan investor terkenal seperti Reid Hoffman, Bill Gates, dan Eric Schmidt. Investasi ini meningkatkan total pendanaan yang diterima perusahaan menjadi $1,525 miliar.

Dalam kolaborasi dengan mitra CoreWeave (CRWV ) dan NVIDIA, Inflection AI membangun klaster AI terbesar di dunia, yang terdiri dari 22.000 GPU Tensor Core H100 NVIDIA. Kekuatan komputasi ini akan mendukung pelatihan dan penerapan generasi baru model AI skala besar, memungkinkan Inflection AI untuk mendorong batas kemampuan di bidang AI pribadi.

Hasil kerja perintis Inflection AI telah menghasilkan hasil yang luar biasa, dengan klaster Inflection AI, yang saat ini terdiri dari lebih dari 3.500 GPU Tensor Core H100 NVIDIA, mencapai kinerja terdepan pada benchmark MLPerf. Dalam pengajuan bersama dengan CoreWeave dan NVIDIA, klaster ini menyelesaikan tugas pelatihan referensi untuk model bahasa besar dalam waktu 11 menit, memperkuat posisinya sebagai klaster tercepat pada benchmark ini.

Prestasi ini mengikuti pengumuman Inflection-1, model LLM internal Inflection AI, yang dipuji sebagai model terbaik di kelas komputasinya. Mengungguli raksasa industri seperti GPT-3.5, LLaMA, Chinchilla, dan PaLM-540B pada berbagai benchmark yang umum digunakan untuk membandingkan LLM, Inflection-1 memungkinkan pengguna berinteraksi dengan Pi, asisten AI pribadi Inflection AI, dengan cara yang sederhana dan alami, menerima informasi dan saran yang cepat, relevan, dan bermanfaat.

Komitmen Inflection AI terhadap transparansi dan reproducibility tercermin dalam rilis memo teknis yang menjelaskan evaluasi dan kinerja Inflection-1 pada berbagai benchmark. Memo ini mengungkapkan bahwa Inflection-1 mengungguli model di kelas komputasi yang sama, yang didefinisikan sebagai model yang dilatih menggunakan paling banyak FLOPs (operasi titik mengambang) dari PaLM-540B.

Keberhasilan Inflection-1 dan peningkatan skala infrastruktur komputasi perusahaan, yang diperkuat oleh putaran pendanaan yang substansial, menyoroti komitmen Inflection AI yang tidak tergoyahkan untuk memenuhi misinya menciptakan AI pribadi untuk semua orang. Dengan integrasi Inflection-1 ke dalam Pi, pengguna sekarang dapat menikmati kekuatan AI pribadi, mendapatkan manfaat dari kepribadian yang empatik, kegunaan, dan standar keamanan.

Inflection-2.5

Inflection-2.5 sekarang tersedia untuk semua pengguna Pi, asisten AI pribadi Inflection AI, di berbagai platform, termasuk web (pi.ai), iOS, Android, dan aplikasi desktop baru. Integrasi ini menandai tonggak penting dalam misi Inflection AI untuk menciptakan AI pribadi untuk semua orang, menggabungkan kemampuan mentah dengan kepribadian yang empatik dan standar keamanan.

Lompatan dalam Kinerja Model sebelumnya Inflection AI, Inflection-1, menggunakan sekitar 4% dari FLOPs (operasi titik mengambang) GPT-4 dan menunjukkan kinerja rata-rata sekitar 72% dibandingkan dengan GPT-4 pada berbagai tugas yang berorientasi pada IQ. Dengan Inflection-2.5, Inflection AI telah mencapai peningkatan substansial dalam kemampuan intelektual Pi, dengan fokus pada pemrograman dan matematika.

Kinerja model pada benchmark industri kunci menunjukkan kehebatannya, menunjukkan lebih dari 94% kinerja rata-rata GPT-4 pada berbagai tugas, dengan penekanan khusus pada unggul dalam bidang STEM. Prestasi luar biasa ini adalah bukti komitmen Inflection AI untuk mendorong batas kemampuan teknologi sambil mempertahankan fokus pada pengalaman pengguna dan keamanan.

Kemampuan Pemrograman dan Matematika Inflection-2.5 bersinar dalam pemrograman dan matematika, menunjukkan perbaikan lebih dari 10% dibandingkan dengan Inflection-1 pada BIG-Bench-Hard, subset masalah yang menantang untuk model bahasa besar. Dua benchmark pemrograman, MBPP+ dan HumanEval+, mengungkapkan perbaikan besar dibandingkan dengan Inflection-1, memperkuat posisi Inflection-2.5 sebagai kekuatan yang harus diperhitungkan dalam domain pemrograman.

Pada benchmark MBPP+, Inflection-2.5 mengungguli pendahulunya dengan margin yang signifikan, menunjukkan kinerja yang setara dengan GPT-4, seperti yang dilaporkan oleh DeepSeek Coder. Serupa, pada benchmark HumanEval+, Inflection-2.5 menunjukkan kemajuan yang luar biasa, mengungguli kinerja Inflection-1 dan mendekati tingkat GPT-4, seperti yang dilaporkan pada papan peringkat EvalPlus.

Dominasi Benchmark Industri

Inflection-2.5 menonjol dalam benchmark industri, menunjukkan perbaikan substansial dibandingkan dengan Inflection-1 pada benchmark MMLU dan GPQA Diamond, yang terkenal karena kesulitan ahli. Kinerja model pada benchmark ini menyoroti kemampuannya untuk menangani berbagai tugas, dari masalah tingkat sekolah menengah hingga tantangan tingkat profesional.

Unggul dalam Ujian STEM Kemampuan model ini juga meluas ke ujian STEM, dengan kinerja yang menonjol pada ujian matematika Hongaria dan Fisika GRE. Pada ujian matematika Hongaria, Inflection-2.5 menunjukkan kemampuan matematika dengan menggunakan prompt dan format yang disediakan, memungkinkan reproduksi yang mudah.

Dalam ujian Fisika GRE, ujian masuk pascasarjana di fisika, Inflection-2.5 mencapai persentil ke-85 dari peserta ujian manusia pada maj@8 (suara mayoritas pada 8), memperkuat posisinya sebagai pesaing yang tangguh dalam bidang pemecahan masalah fisika. Selain itu, model ini mendekati skor tertinggi pada maj@32, menunjukkan kemampuannya untuk menangani masalah fisika yang kompleks dengan akurasi yang luar biasa.

Meningkatkan Pengalaman Pengguna Inflection-2.5 tidak hanya mempertahankan kepribadian dan standar keamanan Pi, tetapi juga meningkatkan statusnya sebagai AI pribadi yang serbaguna dan tak ternilai di berbagai topik. Dari membahas peristiwa terkini hingga mencari rekomendasi lokal, belajar untuk ujian, pemrograman, dan bahkan percakapan santai, Pi yang ditenagai oleh Inflection-2.5 menjanjikan pengalaman pengguna yang ditingkatkan.

Dengan kemampuan Inflection-2.5 yang kuat, pengguna berinteraksi dengan Pi pada berbagai topik lebih dari sebelumnya. Kemampuan model untuk menangani tugas yang kompleks, dikombinasikan dengan kepribadian yang empatik dan kemampuan pencarian web waktu nyata, memastikan bahwa pengguna menerima informasi dan bimbingan yang berkualitas tinggi dan mutakhir.

Adopsi dan Keterlibatan Pengguna Dampak integrasi Inflection-2.5 ke dalam Pi sudah terlihat pada sentimen pengguna, keterlibatan, dan retensi. Inflection AI telah menyaksikan percepatan pertumbuhan pengguna organik yang signifikan, dengan satu juta pengguna aktif harian dan enam juta pengguna aktif bulanan yang bertukar lebih dari empat miliar pesan dengan Pi.

Rata-rata, percakapan dengan Pi berlangsung selama 33 menit, dengan satu dari sepuluh percakapan berlangsung lebih dari satu jam setiap hari. Selain itu, sekitar 60% orang yang berinteraksi dengan Pi dalam seminggu kembali pada minggu berikutnya, menunjukkan keterikatan bulanan yang lebih tinggi dibandingkan dengan pesaing utama di bidang ini.

Rincian Teknis dan Transparansi Benchmark

Sejalan dengan komitmen Inflection AI terhadap transparansi dan reproduktivitas, perusahaan telah menyediakan hasil teknis yang komprehensif dan rincian tentang kinerja Inflection-2.5 pada berbagai benchmark industri.

Misalnya, pada versi yang diperbaiki dari dataset MT-Bench, yang menangani masalah dengan solusi referensi yang tidak benar dan premis yang bermasalah dalam dataset asli, Inflection-2.5 menunjukkan kinerja yang sesuai dengan harapan berdasarkan benchmark lain.

Inflection AI juga telah mengevaluasi Inflection-2.5 pada HellaSwag dan ARC-C, benchmark kesadaran umum dan sains yang dilaporkan oleh berbagai model, dan hasilnya menunjukkan kinerja yang kuat pada benchmark ini.

Penting untuk dicatat bahwa sementara evaluasi yang disediakan mewakili model yang menyalakan Pi, pengalaman pengguna mungkin berbeda sedikit karena faktor seperti dampak pengambilan web (tidak digunakan dalam benchmark), struktur prompt few-shot, dan perbedaan sisi produksi lainnya.

Kesimpulan

Inflection-2.5 mewakili lompatan besar dalam bidang model bahasa besar, menyaingi kemampuan pemimpin industri seperti GPT-4 dan Gemini sambil menggunakan hanya sebagian kecil dari sumber daya komputasi. Dengan kinerja yang mengesankan pada berbagai benchmark, terutama di bidang STEM, pemrograman, dan matematika, Inflection-2.5 telah memposisikan dirinya sebagai pesaing yang tangguh dalam lanskap AI.

Integrasi Inflection-2.5 ke dalam Pi, asisten AI pribadi Inflection AI, menjanjikan pengalaman pengguna yang ditingkatkan, menggabungkan kemampuan mentah dengan kepribadian yang empatik dan standar keamanan. Ketika Inflection AI terus mendorong batas kemampuan LLM, komunitas AI dengan sabar menantikan gelombang inovasi dan kemajuan berikutnya dari perusahaan perintis ini.

Saya telah menghabiskan lima tahun terakhir dengan membenamkan diri dalam dunia Machine Learning dan Deep Learning yang menarik. Minat dan keahlian saya telah memimpin saya untuk berkontribusi pada lebih dari 50 proyek rekayasa perangkat lunak yang beragam, dengan fokus khusus pada AI/ML. Rasa ingin tahu saya yang terus-menerus juga telah menarik saya ke arah Natural Language Processing, sebuah bidang yang saya ingin jelajahi lebih lanjut.