Un equipo del MIT ha avanzado significativamente en la solución de tareas abstractas utilizando un modelo de lenguaje de 8 mil millones de metros (LLM) y una técnica innovadora llamada Capacitación en tiempo de prueba (TTT). Con un rendimiento del 61,9% en el parámetro ARC-AGI-PUB, superaron significativamente el registro anterior del 42%. Estos resultados son notables ya que el ARC-AGI-PUB es una colección desafiante de tareas que requieren reconocimiento de patrones visuales y razonamiento complejo.
¿Qué es el entrenamiento de tiempo de prueba (TTT)? TTT es una técnica que permite al modelo hacer pequeños ajustes durante el tiempo de prueba para reaccionar a nuevas tareas. TTT utiliza el contexto de los datos de entrada para optimizar temporalmente el modelo para la tarea actual. Este enfoque difiere de los métodos tradicionales en los que el modelo está capacitado para una tarea de antemano. Especialmente en tareas complejas y novedosas, TTT muestra fuertes mejoras de rendimiento.
¿Cómo fue el avance en el trabajo del MIT? El equipo encontró que una combinación de ajuste inicial y la aplicación de transformaciones especiales para probar datos era crucial para el éxito. Estos ajustes mejoraron la capacidad del modelo para reconocer patrones. Además, se creó un conjunto con enfoques de programación modernos para aumentar el valor de rendimiento al 61,9%, un rendimiento equivalente al de un humano promedio.
La importancia de este desarrollo Los resultados muestran que los modelos de lenguaje pueden resolver tareas abstractas incluso sin métodos simbólicos explícitos.
Leer más en el documento oficial.



















