DeepSeek ha dado el golpe definitivo a su estrategia de producto. El mismo día que ha puesto a la venta su modelo más potente, DeepSeek V4 Pro, la compañía china ha abierto al mundo su propio framework de agentes inteligentes, DeepSeek Harness, y ha anunciado una subida de precios de su API que en algunos tramos alcanza el 1100%.
El mensaje es claro: DeepSeek ya no compite por ser el más barato; compite por ser el que te da las herramientas para trabajar.
El lanzamiento que lo cambia todo: DeepSeek Harness sale a la luz
El 13 de agosto de 2026, DeepSeek movió ficha en dos frentes simultáneamente. Por un lado, liberó la versión oficial de DeepSeek V4 Pro, su modelo insignia con 1,6 billones de parámetros totales (49.000 millones activados en cada inferencia) y una ventana de contexto de un millón de tokens.
Por otro lado, abrió al público la versión 0.1 de DeepSeek Harness, un framework de agentes (agent harness) publicado bajo licencia MIT, es decir, completamente gratuito y de código abierto.
La fórmula que resume su propósito la dio la propia compañía en sus ofertas de empleo: Model + Harness = Agent. El modelo es el cerebro; el Harness es el sistema nervioso ejecutor que le permite operar archivos, ejecutar comandos y encadenar tareas reales.
El impacto fue inmediato: en apenas 24 horas, el repositorio superó los 80.000 ‘stars’ en GitHub, superando el acumulado histórico de Grok-1 de xAI.
¿Qué es exactamente DeepSeek Harness y por qué es tan importante en la batalla de la IA?
Para entender qué ha lanzado DeepSeek hay que partir de una distinción fundamental. Un modelo de lenguaje por sí solo no puede tocar tu ordenador: puede razonar, escribir y planificar, pero no tiene manos para abrir archivos, navegar por internet o ejecutar código en un terminal.
Esa capa intermedia (la que conecta el cerebro con las herramientas) es precisamente lo que se conoce como Harness.
DeepSeek lo define como “el sistema nervioso ejecutor” , un anillo de control y orquestación que rodea al modelo y le permite convertir su razonamiento en acciones concretas sobre el entorno. Hasta ahora, esa capa estaba dominada por herramientas como Claude Code de Anthropic o Codex de OpenAI, ambas propietarias y cerradas.
La arquitectura que lo cambia todo: todo es un plugin
La seña de identidad del proyecto es su principio de diseño: “todo es un plugin” . Modelos, herramientas, skills, sesiones, sandbox, almacenamiento, bucles de agente, scheduler e incluso la interfaz de usuario son componentes intercambiables que se ensamblan como piezas de Lego.
Esto se apoya en Cordis, un framework de plugins con cuatro años de recorrido en el proyecto de chatbots Koishi, que DeepSeek ha adoptado como base para Harness. La clave es que ningún desarrollador necesita tocar el código fuente: basta con configurar qué plugins quiere activar para construir un agente completamente personalizado.
Cuatro modos de uso: del benchmark al agente creativo
DeepSeek Harness no es una herramienta monolítica. La compañía ha diseñado cuatro perfiles de ejecución que cargan conjuntos de plugins predeterminados según el caso de uso:
- Modo estándar: la configuración completa, con todas las herramientas disponibles para un agente generalista.
- Modo PTC (Programmatic Tool Calling): el modelo genera código que encadena múltiples llamadas a herramientas en un solo paso, optimizando la eficiencia.
- Modo minimalista: solo un shell y un editor de archivos, pensado para benchmarks en entornos controlados.
- Modo creativo: permite inspeccionar el runtime, experimentar con plugins Cordis en memoria y crear nuevos modos sobre la marcha.
Este último es especialmente relevante: los agentes pueden modificarse a sí mismos durante la ejecución, un paso hacia la autoevolución de los sistemas de IA.
Los números de DeepSeek V4 Pro: un salto de calidad innegable
La versión oficial de DeepSeek V4 Pro no ha venido sola. Sus mejoras en las evaluaciones de capacidad agéntica son difíciles de ignorar. El benchmark interno DeepSWE, que mide la capacidad de un agente para modificar código en un repositorio real, ha pasado de una puntuación de 12,8 en la versión preview a 62,7 en la versión oficial, un salto de casi 50 puntos.
En CyberGym, una prueba de ciberseguridad ofensiva y defensiva, V4 Pro alcanza 83,3 puntos, superando a Claude Fable 5 de Anthropic. En Terminal-Bench 2.1, que mide la capacidad de un agente para operar en un entorno de terminal, roza los 87,9 puntos, apenas un punto por debajo del referente de Anthropic.
La conclusión de los analistas independientes de Artificial Analysis es que DeepSeek ha cerrado la brecha: otorgan a V4 Pro una puntuación de 53 en su Índice de Inteligencia, frente a 40 de V4 Flash.
Descubre más desde CIBERED
Suscríbete y recibe las últimas entradas en tu correo electrónico.

