Modelos y plataformas de IA
Escalado en el momento de la prueba: La salsa secreta detrás de la nueva ola de modelos de razonamiento de nivel de doctorado

El campo de la inteligencia artificial ha llegado a un punto en el que simplemente agregar más datos o aumentar el tamaño de un modelo no es la mejor manera de hacerlo más inteligente. Durante los últimos años, creíamos que si construíamos redes neuronales más grandes y les alimentábamos más de Internet, eventualmente se volverían más inteligentes. Este enfoque, conocido como leyes de escalado, funcionó de manera notable. Nos dio modelos que pueden escribir poesía, traducir idiomas y aprobar el examen de la barra. Sin embargo, estos modelos a menudo luchaban con la lógica profunda, las matemáticas complejas y los problemas científicos de varios pasos. Eran excelentes para el reconocimiento de patrones, pero a menudo fallaban en problemas que requieren razonamiento de varios pasos.
Recientemente, ha surgido una nueva tendencia que está cambiando la forma en que pensamos sobre las capacidades de la IA. Esta tendencia se llama escalado en el momento de la prueba. En lugar de centrarse solo en cuanto aprende un modelo durante su fase de entrenamiento, los investigadores ahora se centran en cuanto “piensa” el modelo cuando en realidad está respondiendo a una pregunta. Este cambio es la salsa secreta detrás de la última ola de modelos de razonamiento, como la serie o1 de OpenAI, que ahora están funcionando a nivel de estudiantes de doctorado en materias difíciles como física, química y biología.
El cambio de escalado de entrenamiento a escalado de inferencia
Para entender por qué este es un cambio importante, debemos mirar cómo se construyó la IA hasta ahora. Tradicionalmente, la “inteligencia” de un modelo se determinaba en función de su entrenamiento. Esto implicaba gastar meses y millones de dólares para ejecutar grandes cantidades de datos a través de miles de GPU. Una vez que el entrenamiento estaba terminado, el modelo estaba esencialmente congelado. Cuando le hacías una pregunta, proporcionaba una respuesta casi instantáneamente en función de los patrones que ya había aprendido. Esto es lo que llamamos inferencia o momento de la prueba.
El problema con este enfoque tradicional es que el modelo solo tiene una oportunidad de acertar. Procesa el prompt y genera tokens uno después de otro sin forma de “pensar” o “verificar” su lógica antes de hablar. El escalado en el momento de la prueba cambia esta dinámica. Permite que el modelo utilice más potencia computacional durante la fase de inferencia. Al igual que un ser humano puede tardar unos segundos en responder a una pregunta simple, pero varios minutos o horas en resolver un problema matemático complejo, los modelos de IA ahora están diseñados para escalar su esfuerzo en función de la dificultad de la tarea.
Definiendo el concepto de escalado en el momento de la prueba
El escalado en el momento de la prueba se refiere a las técnicas que permiten a un modelo de IA utilizar recursos computacionales adicionales para procesar una solicitud en el momento de la entrega. En términos simples, significa darle al modelo más “tiempo de pensamiento”. Esto no se trata de hacer que el modelo sea más grande; se trata de hacer que el modelo sea más deliberado. Cuando un modelo utiliza el escalado en el momento de la prueba, no produce simplemente la primera respuesta que se le ocurre. En cambio, puede explorar diferentes caminos, verificar errores en su propia lógica y refinar su respuesta antes de que el usuario la vea.
Este concepto a menudo se compara con la forma en que funciona el cerebro humano. Los psicólogos a menudo hablan de “Sistema 1” y “Sistema 2” de pensamiento. El Sistema 1 es rápido, instintivo y emocional. Es lo que usas cuando reconoces una cara o conduces un coche por una carretera familiar. El Sistema 2 es más lento, más deliberado y lógico. Es lo que usas cuando resuelves una ecuación matemática difícil o planeas un proyecto complejo. Hasta hace poco, los LLM eran principalmente pensadores del Sistema 1. El escalado en el momento de la prueba es el puente que les permite acceder al pensamiento del Sistema 2.
La mecánica del proceso de razonamiento
Hay varias formas en que los investigadores logran el escalado en el momento de la prueba. Uno de los métodos más comunes se llama Chain of Thought (CoT) prompting, pero en estos nuevos modelos, está integrado directamente en el sistema en lugar de ser algo que el usuario debe solicitar. El modelo está entrenado para descomponer un problema en pasos lógicos más pequeños. Al hacer esto, el modelo puede verificar cada parte de la solución antes de pasar a la siguiente.
Otra técnica importante implica algoritmos de búsqueda, como Monte Carlo Tree Search. En lugar de simplemente predecir la próxima palabra más probable, el modelo genera múltiples caminos posibles para una respuesta. Evalúa estos caminos y determina cuál es más probable que conduzca a una solución correcta. Si llega a un callejón sin salida o se da cuenta de que un paso anterior estaba mal, puede retroceder y probar un enfoque diferente. Esta capacidad de “mirar hacia adelante” es muy similar a cómo un motor de ajedrez evalúa miles de movimientos posibles antes de elegir el mejor. Al buscar a través de muchas posibilidades durante la fase de inferencia, el modelo puede resolver problemas mucho más complejos de los que se pueden resolver directamente utilizando un LLM estándar.
Por qué el razonamiento de nivel de doctorado requiere más que memoria
La razón por la que esto es tan importante es que el razonamiento de alto nivel en ciencia y matemáticas no se puede resolver solo con memoria. En un examen de física de nivel de doctorado, no puedes simplemente repetir un hecho que leíste en un libro de texto. Debes aplicar principios complejos a una situación nueva y única. Los modelos estándar a menudo alucinan en estos escenarios porque están tratando de predecir la próxima palabra en función de la probabilidad en lugar de la lógica.
El escalado en el momento de la prueba permite que el modelo actúe más como un investigador. Puede probar hipótesis internamente. Por ejemplo, si se le pide a un modelo que escriba un código complejo, puede “ejecutar” la lógica en su cadena de pensamiento oculta, identificar un error potencial y corregirlo antes de presentar el código final. Esta capacidad de autocorrección es lo que permite que la nueva ola de modelos obtenga altas puntuaciones en benchmarks como el American Invitational Mathematics Examination (AIME) o el GPQA (una prueba científica difícil diseñada por expertos). No están simplemente adivinando; están verificando.
El intercambio de eficiencia y costos de cómputo
Aunque el escalado en el momento de la prueba es poderoso, conlleva un costo significativo. En la forma antigua de hacer las cosas, la parte más costosa de la IA era el entrenamiento. Una vez que el modelo estaba desplegado, ejecutarlo era relativamente barato y rápido. Con el escalado en el momento de la prueba, el costo se desplaza hacia la solicitud del usuario. Debido a que el modelo está haciendo más trabajo al generar múltiples caminos y verificar su propio trabajo, tarda más tiempo en responder y requiere más recursos de hardware.
Esto crea una nueva economía para la IA. Estamos moviéndonos hacia una situación en la que el “costo por consulta” puede variar enormemente. Una pregunta simple sobre el clima puede costar una fracción de centavo y tardar un segundo. Una investigación científica profunda puede costar varios dólares en tiempo de cómputo y puede tardar una hora en procesarse. Este intercambio es necesario para lograr un razonamiento de alto nivel, pero también significa que los desarrolladores deben encontrar formas de hacer que estos modelos sean eficientes para que puedan usarse a gran escala en industrias como la medicina o la ingeniería.
El impacto en el futuro de la inteligencia artificial
El surgimiento del escalado en el momento de la prueba sugiere que podemos estar entrando en una nueva era de desarrollo de IA. Durante años, hubo una preocupación de que eventualmente nos quedaríamos sin datos de alta calidad para entrenar modelos. Si los modelos solo aprenden de lo que los humanos ya han escrito, pueden llegar a un techo. Sin embargo, el escalado en el momento de la prueba muestra que los modelos pueden mejorar su rendimiento pensando más, no solo leyendo más.
Esto abre la puerta a que la IA haga sus propios descubrimientos. Si un modelo puede razonar a través de un problema que nunca ha visto antes, puede potencialmente encontrar nuevas soluciones en ciencia de materiales, descubrimiento de fármacos o energía renovable. Se mueve de ser un asistente útil que resume texto a ser un colaborador digital que puede ayudar a resolver los problemas más difíciles del mundo. Estamos viendo un movimiento desde la “IA generativa” hacia la “IA de razonamiento”.
En resumen
El escalado en el momento de la prueba está demostrando ser el eslabón perdido en la búsqueda de una inteligencia artificial avanzada. Al permitir que los modelos utilicen más cómputo en el momento de la inferencia, hemos desbloqueado un nivel de rendimiento que se pensaba que estaba años por delante. Estos modelos están comenzando a demostrar un tipo de lógica que se siente mucho más cercana a la inteligencia humana que el simple reconocimiento de patrones del pasado.
A medida que avanzamos, el desafío será perfeccionar estas técnicas. Necesitamos hacer que el razonamiento sea más rápido y más accesible mientras encontramos el equilibrio correcto entre “pensamiento rápido” y “pensamiento lento”. La salsa secreta ya no es solo el tamaño del modelo o la cantidad de datos que ha visto. La salsa secreta es cómo el modelo utiliza su tiempo para pensar. Para cualquiera que siga el progreso de la IA, es claro que el enfoque ha cambiado. La carrera ya no es solo sobre quién tiene el modelo más grande, sino sobre quién tiene el modelo que puede razonar mejor. Este cambio probablemente definirá la próxima década de innovación en el campo.












