Grok 4.5 ha alcanzado el primer puesto en la clasificación Long-Horizon Terminal-Bench (LHTB) de julio de 2026, según informó Elon Musk.
El modelo estableció un nuevo récord en esta prueba, diseñada para evaluar agentes de IA capaces de resolver tareas complejas mediante planificación a largo plazo y ejecución de múltiples pasos en un entorno de línea de comandos.
El Long-Horizon Terminal-Bench (LHTB) es un benchmark especializado que mide la capacidad de los modelos para abordar problemas que requieren análisis, planificación secuencial y toma de decisiones durante largos procesos de ejecución.
Según los resultados publicados, Grok 4.5 obtuvo una puntuación media de 0,505, resolviendo con éxito 13 de las 46 tareas del conjunto de pruebas.
El avance resulta especialmente llamativo si se compara con la versión anterior, Grok 4.20 que no logró completar ninguna de las tareas del mismo benchmark.
De acuerdo con la clasificación compartida, Grok 4.5 superó a varios de los modelos más avanzados del momento, entre ellos:
- Claude Sonnet 5
- Claude Opus 4.8
- Fable 5
- GPT-5.5
- y otros modelos de IA de última generación.
Aunque estos resultados reflejan un excelente desempeño en Long-Horizon Terminal-Bench, conviene recordar que ningún benchmark individual determina cuál es el “mejor” modelo de IA en términos generales.
Cada prueba evalúa capacidades específicas, y el rendimiento puede variar significativamente según el tipo de tarea (programación, razonamiento, matemáticas, escritura, agentes, multimodalidad o velocidad).
Por ello, es recomendable considerar múltiples evaluaciones independientes antes de extraer conclusiones sobre el rendimiento global de un modelo.
