Un team di MIT ha fatto progressi significativi nella soluzione astratta delle attività utilizzando un modello linguistico di 8 miliardi (LLM) e una tecnica innovativa chiamata Test-Time Training (TTT). Con una performance del 61,9% sul benchmark ARC-AGI-PUB, hanno notevolmente superato il record precedente del 42%. Questi risultati sono notevoli in quanto ARC-AGI-PUB è una raccolta impegnativa di compiti che richiedono il riconoscimento del pattern visivo e il ragionamento complesso.
Cos’è la formazione del test-tempo (TTT)? TTT è una tecnica che permette al modello di effettuare piccole regolazioni durante il tempo di prova per reagire a nuovi compiti. TTT utilizza il contesto dei dati di input per ottimizzare temporaneamente il modello per l’attività corrente. Questo approccio differisce dai metodi tradizionali in cui il modello è formato per un compito in anticipo. Soprattutto in compiti complessi e nuovi, TTT mostra forti miglioramenti delle prestazioni.
Come ha funzionato la svolta al MIT? Il team ha scoperto che una combinazione di fine-tuning iniziale e l’applicazione di trasformazioni speciali per testare i dati è stata cruciale per il successo. Queste modifiche hanno migliorato la capacità del modello di riconoscere i modelli. Inoltre, è stato creato un insieme con approcci di programmazione moderni per aumentare il valore delle prestazioni al 61,9% – una performance equivalente a quella di un umano medio.
Il significato di questo sviluppo I risultati mostrano che i modelli linguistici possono risolvere compiti astratti anche senza metodi simbolici espliciti.
Leggi tutto in carta ufficiale.



















