IAG e IA del futuro

Inflection-2.5: El potente modelo de lenguaje rivalizando con GPT-4 y Gemini

mm
Añade Unite.AI a tus fuentes preferidas en Google

Inflection AI ha estado haciendo olas en el campo de los grandes modelos de lenguaje (LLM) con su reciente presentación de Inflection-2.5, un modelo que compite con los LLM líderes del mundo, incluyendo GPT-4 de OpenAI y Gemini de Google.

El rápido ascenso de Inflection AI ha sido aún más impulsado por una masiva inversión de $1.300 millones, liderada por gigantes de la industria como Microsoft (MSFT ), NVIDIA (NVDA ) y destacados inversores como Reid Hoffman, Bill Gates y Eric Schmidt. Esta importante inversión eleva la cantidad total de fondos recaudados por la empresa a $1.525 mil millones.

En colaboración con sus socios CoreWeave (CRWV ) y NVIDIA, Inflection AI está construyendo el mayor clúster de inteligencia artificial del mundo, que consta de un sin precedentes 22.000 GPU Tensor Core H100 de NVIDIA. Esta enorme potencia de cálculo respaldará la capacitación y despliegue de una nueva generación de modelos de inteligencia artificial a gran escala, lo que permitirá a Inflection AI empujar los límites de lo que es posible en el campo de la inteligencia artificial personal.

El trabajo innovador de la empresa ya ha producido resultados notables, con el clúster de Inflection AI, que actualmente consta de más de 3.500 GPU Tensor Core H100 de NVIDIA, logrando un rendimiento de vanguardia en la referencia de benchmark MLPerf. En una presentación conjunta con CoreWeave y NVIDIA, el clúster completó la tarea de capacitación de referencia para grandes modelos de lenguaje en solo 11 minutos, consolidando su posición como el clúster más rápido en este benchmark.

Este logro sigue a la presentación de Inflection-1, el modelo de lenguaje grande de Inflection AI, que ha sido aclamado como el mejor modelo en su clase de cálculo. Superando a gigantes de la industria como GPT-3.5, LLaMA, Chinchilla y PaLM-540B en una amplia gama de benchmarks comúnmente utilizados para comparar LLM, Inflection-1 permite a los usuarios interactuar con Pi, la inteligencia artificial personal de Inflection AI, de una manera simple y natural, recibiendo información y consejos rápidos, relevantes y útiles.

El compromiso de Inflection AI con la transparencia y la reproducibilidad es evidente en la publicación de un memorando técnico que detalla la evaluación y el rendimiento de Inflection-1 en varios benchmarks. El memorando revela que Inflection-1 supera a los modelos en la misma clase de cálculo, definida como modelos entrenados utilizando como máximo las operaciones de punto flotante (FLOPs) de PaLM-540B.

El éxito de Inflection-1 y la rápida escalada de la infraestructura de cálculo de la empresa, impulsada por la sustancial ronda de financiación, resaltan el compromiso inquebrantable de Inflection AI para cumplir con su misión de crear una inteligencia artificial personal para todos. Con la integración de Inflection-1 en Pi, los usuarios pueden experimentar el poder de una inteligencia artificial personal, beneficiándose de su personalidad empática, utilidad y estándares de seguridad.

Inflection-2.5

Inflection-2.5 ya está disponible para todos los usuarios de Pi, la inteligencia artificial personal de Inflection AI, en múltiples plataformas, incluyendo la web (pi.ai), iOS, Android y una nueva aplicación de escritorio. Esta integración marca un hito significativo en la misión de Inflection AI de crear una inteligencia artificial personal para todos, combinando la capacidad bruta con su personalidad empática y estándares de seguridad característicos.

Un salto en el rendimiento El modelo anterior de Inflection AI, Inflection-1, utilizaba aproximadamente el 4% de las operaciones de punto flotante (FLOPs) de GPT-4 y exhibía un rendimiento promedio de alrededor del 72% en comparación con GPT-4 en diversas tareas orientadas a la inteligencia. Con Inflection-2.5, Inflection AI ha logrado un aumento sustancial en las capacidades intelectuales de Pi, con un enfoque en codificación y matemáticas.

El rendimiento del modelo en los benchmarks de la industria demuestra su destreza, mostrando más del 94% del rendimiento promedio de GPT-4 en diversas tareas, con un énfasis particular en destacarse en áreas de ciencia, tecnología, ingeniería y matemáticas (STEM). Este logro notable es un testimonio del compromiso de Inflection AI para impulsar la frontera tecnológica mientras mantiene un enfoque inquebrantable en la experiencia del usuario y la seguridad.

Destreza en codificación y matemáticas Inflection-2.5 brilla en codificación y matemáticas, demostrando una mejora del más del 10% en comparación con Inflection-1 en BIG-Bench-Hard, un subconjunto de problemas desafiantes para grandes modelos de lenguaje. Dos benchmarks de codificación, MBPP+ y HumanEval+, revelan mejoras masivas en comparación con Inflection-1, consolidando la posición de Inflection-2.5 como una fuerza a tener en cuenta en el dominio de la codificación.

En el benchmark MBPP+, Inflection-2.5 supera a su predecesor por un margen significativo, exhibiendo un nivel de rendimiento comparable al de GPT-4, según lo informado por DeepSeek Coder. De manera similar, en el benchmark HumanEval+, Inflection-2.5 demuestra un progreso notable, superando el rendimiento de Inflection-1 y acercándose al nivel de GPT-4, según lo informado en la clasificación EvalPlus.

Dominio de los benchmarks de la industria

Inflection-2.5 se destaca en los benchmarks de la industria, mostrando mejoras sustanciales en comparación con Inflection-1 en el benchmark MMLU y el benchmark GPQA Diamond, conocido por su dificultad a nivel de experto. El rendimiento del modelo en estos benchmarks subraya su capacidad para manejar una amplia gama de tareas, desde problemas de nivel de escuela secundaria hasta desafíos a nivel profesional.

Destacándose en exámenes de STEM El modelo también muestra un rendimiento destacado en exámenes de STEM, como el examen de matemáticas húngaro y el examen de física GRE. En el examen de matemáticas húngaro, Inflection-2.5 demuestra su aptitud matemática aprovechando el prompt de pocos disparos y el formato proporcionados, lo que permite una fácil reproducibilidad.

En el examen de física GRE, un examen de admisión a posgrado en física, Inflection-2.5 alcanza el percentil 85 de los examinados humanos en maj@8 (voto mayoritario a 8), consolidando su posición como un contendiente formidable en el ámbito de la resolución de problemas de física. Además, el modelo se acerca a la puntuación máxima en maj@32, exhibiendo su capacidad para abordar problemas de física complejos con una precisión notable.

Mejorando la experiencia del usuario Inflection-2.5 no solo mantiene la personalidad empática y los estándares de seguridad característicos de Pi, sino que también eleva su estatus como una inteligencia artificial personal versátil y valiosa en una variedad de temas. Desde discutir eventos actuales hasta buscar recomendaciones locales, estudiar para exámenes, codificar y incluso conversaciones informales, Pi impulsado por Inflection-2.5 promete una experiencia del usuario enriquecida.

Con las capacidades poderosas de Inflection-2.5, los usuarios están interactuando con Pi en una gama más amplia de temas que nunca antes. La capacidad del modelo para manejar tareas complejas, combinada con su personalidad empática y capacidades de búsqueda web en tiempo real, garantiza que los usuarios reciban información y orientación de alta calidad y actualizada.

Adopción y compromiso del usuario El impacto de la integración de Inflection-2.5 en Pi ya es evidente en las métricas de sentimiento, compromiso y retención del usuario. Inflection AI ha presenciado una aceleración significativa en el crecimiento de usuarios diarios y mensuales, con un millón de usuarios diarios y seis millones de usuarios mensuales intercambiando más de cuatro mil millones de mensajes con Pi.

En promedio, las conversaciones con Pi duran 33 minutos, y una de cada diez conversaciones dura más de una hora cada día. Además, aproximadamente el 60% de las personas que interactúan con Pi en una semana determinada regresan la semana siguiente, mostrando una mayor fidelidad mensual que los competidores líderes en el campo.

Detalles técnicos y transparencia de los benchmarks

En línea con el compromiso de Inflection AI con la transparencia y la reproducibilidad, la empresa ha proporcionado resultados técnicos y detalles completos sobre el rendimiento de Inflection-2.5 en varios benchmarks de la industria.

Por ejemplo, en la versión corregida del conjunto de datos MT-Bench, que aborda problemas con soluciones de referencia incorrectas y premisas defectuosas en el conjunto de datos original, Inflection-2.5 demuestra un rendimiento acorde con las expectativas basadas en otros benchmarks.

Inflection AI también ha evaluado Inflection-2.5 en HellaSwag y ARC-C, benchmarks de sentido común y ciencia informados por una amplia gama de modelos, y los resultados muestran un rendimiento sólido en estos benchmarks saturados.

Es importante destacar que, aunque las evaluaciones proporcionadas representan el modelo que impulsa Pi, la experiencia del usuario puede variar ligeramente debido a factores como el impacto de la recuperación web (no utilizada en los benchmarks), la estructura de la activación de pocos disparos y otras diferencias en la producción.

Conclusión

Inflection-2.5 representa un avance significativo en el campo de los grandes modelos de lenguaje, rivalizando con las capacidades de los líderes de la industria como GPT-4 y Gemini, mientras utiliza solo una fracción de los recursos de cálculo. Con su impresionante rendimiento en una amplia gama de benchmarks, particularmente en áreas de STEM, codificación y matemáticas, Inflection-2.5 se ha posicionado como un contendiente formidable en el panorama de la inteligencia artificial.

La integración de Inflection-2.5 en Pi, la inteligencia artificial personal de Inflection AI, promete una experiencia del usuario enriquecida, combinando la capacidad bruta con la personalidad empática y los estándares de seguridad. A medida que Inflection AI continúa empujando los límites de lo que es posible con los grandes modelos de lenguaje, la comunidad de inteligencia artificial aguarda ansiosamente la próxima ola de innovaciones y avances de esta empresa pionera.

He dedicado los últimos cinco años sumergiéndome en el fascinante mundo de Machine Learning y Deep Learning. Mi pasión y experiencia me han llevado a contribuir a más de 50 proyectos de ingeniería de software diversos, con un enfoque particular en AI/ML. Mi curiosidad en curso también me ha llevado hacia el Procesamiento de Lenguaje Natural, un campo que estoy ansioso por explorar más a fondo.