El modelo, disponible únicamente dentro de Devin, introduce niveles de esfuerzo de razonamiento seleccionables y reduce drásticamente el número de pasos y el coste frente a su predecesor. No tiene pesos abiertos ni API independiente.
Cognition, la empresa detrás del agente de codificación Devin, ha presentado SWE-2, su modelo de codificación más capaz hasta la fecha. El modelo ha sido post-entrenado con aprendizaje por refuerzo (RL) a partir de Kimi K3, el modelo abierto de 2,8 billones de parámetros desarrollado por Moonshot AI. Según los datos publicados por la compañía, SWE-2 alcanza una puntuación del 50,0% en FrontierCode 1.1 Main, a solo un punto de Fable 5.1 (50,9%) pero con un coste un 64% inferior.
GPT-6 Astra ya está aquí: nuevas capacidades, benchmarks y cómo acceder
Se trata, además, del primer modelo de Cognition con niveles de esfuerzo de razonamiento seleccionables, todos ellos entrenados en una única ejecución de RL. La empresa afirma que su algoritmo de RL todavía encuentra margen sustancial sobre K3, añadiendo entre 5 y 6 puntos en numerosos benchmarks.
Disponibilidad limitada
SWE-2 no está disponible para su despliegue en infraestructura propia. No tiene pesos abiertos ni una API independiente. Funciona exclusivamente dentro de Devin: en las versiones Desktop y CLI por ahora, con Devin Web y Fusion en proceso de implementación. La compañía ofrece acceso gratuito para los niveles de pago hasta el 10 de octubre de 2026.
Google revoluciona Gmail, Docs y Keep con Gemini: ahora todo se hace por voz
Resultados en benchmarks
Cognition ha publicado una tabla comparativa con los resultados de SWE-2 frente a otros modelos. Los datos proceden de evaluaciones públicas cuando están disponibles; en caso contrario, cada modelo se ejecuta en su entorno nativo con el mejor esfuerzo posible.
| Benchmark | SWE-2 | Kimi K3 | Grok 4.6 | Fable 5.1 | GPT-5.6 Sol | GPT-6 Astra | SWE-1.7 |
|---|---|---|---|---|---|---|---|
| FrontierCode 1.1 Main | 50,0% | 44,2% | 48,0% | 50,9% | 47,5% | 53,3% | 42,0% |
| DeepSWE 1.1 | 73,0% | 68,5% | 67,5% | 67,4% | 72,7% | 74,1% | 37,7% |
| Terminal-Bench 2.1 | 92,8% | 88,3% | 88,4% | 91,4% | 88,8% | 89,9% | 81,5% |
| Terminal-Bench 4 | 27,3% | 21,5% | 20,3% | 55,8% | 37,3% | 57,9% | 7,6% |
SWE-2 lidera en Terminal-Bench 2.1 y supera a su base K3 en todas las filas. Cognition señala que se queda a unos pocos puntos de GPT-6 Astra con un coste cuatro veces menor. Su punto débil más evidente es Terminal-Bench 4, donde SWE-2 queda aproximadamente 30 puntos por detrás de Fable 5.1 y GPT-6 Astra. FrontierCode es un benchmark propio de Cognition, y todas las cifras de los rivales provienen de la evaluación realizada por la propia compañía.
Comportamiento del modelo: menos desvíos
SWE-1.7 tendía a explorar en exceso en tareas simples. SWE-2 aborda este problema mediante lo que Cognition denomina “exploración enfocada”. En FrontierCode 1.1 Main, la versión media de SWE-2 obtiene una puntuación superior a SWE-1.7 mientras realiza un 58% menos de turnos y cuesta un 81% menos. La media de pasos por ejecución se reduce de 127 (SWE-1.7) a 53 (medio), 80 (alto) y 98 (máximo). SWE-2 medio realiza su primera edición real tras una mediana de 18 pasos, frente a los 48 de SWE-1.7.
El equipo de Cognition también informa de tres patrones de comportamiento: una cobertura de pruebas de extremo a extremo más sólida, mayor capacidad de recurso cuando una herramienta se bloquea y disciplina de verificación. Cuando se le cuestiona, el modelo vuelve a derivar sus conclusiones en lugar de reafirmarlas.
¿Cómo se entrenó?
El entrenamiento de SWE-2 introduce varias innovaciones técnicas:
- Penalizaciones de coste informadas por el Pareto: La recompensa se define como R = S menos lambda por C, donde S es el éxito binario y C combina el coste de inferencia en dólares con el tiempo de rollout. Cognition demuestra que solo una penalización lineal hace que el objetivo de RL dependa exclusivamente del coste medio y la tasa de resolución. Cada nivel de esfuerzo tiene su lambda ajustada a la pendiente local de la curva de Pareto del modelo base.
- Línea base de recompensa ponderada por longitud: La magnitud del gradiente correlaciona fuertemente con la longitud del rollout, por lo que la línea base del grupo se pondera por tokens. En pruebas de ablación, esto mantuvo más baja la divergencia KL entre inferencia y entrenamiento y estabilizó el entrenamiento sin coste computacional adicional.
- Servicio de rollouts y numérica: Un retardador de prefill agrupa solicitudes cercanas, elevando el TPM por GPU y el TPS por petición entre un 10% y un 20%. La decodificación especulativa DSpark acelera los rollouts, con un modelo borrador reentrenado mediante SpecForge para longitudes de aceptación un 15% mayores y luego entrenado en línea junto con la política. Los kernels NVFP4 y FP8 con entrenamiento consciente de la cuantización mantienen bajo el uso de memoria y reducen el desajuste entre entrenamiento e inferencia por debajo de los niveles de SWE-1.7.
- Datos: Cognition triplicó sus entornos de RL, añadió capas de seguimiento de instrucciones y construyó un mecanismo que utiliza puntos de control anteriores de SWE-2 para corregir falsos positivos y negativos en los verificadores.
Comprobaciones de fiabilidad
Cognition volvió a ejecutar dos evaluaciones de su estudio de fiabilidad de código abierto. En 145 preguntas políticamente sensibles sobre China, SWE-2 superó el 98,0% global: 99,8% en inglés, 95,2% en chino simplificado y 99,1% en chino tradicional. En una prueba de vulnerabilidad dependiente del contexto a través de distintos encuadres de cliente, ningún encuadre produjo un cambio estadísticamente significativo para ningún modelo.
DeepSeek retira V4 Pro menos de 24 horas después de su lanzamiento
Conclusión
SWE-2 representa un avance notable para Cognition: un modelo que compite con los principales referentes del sector en varios benchmarks y lo hace con un coste significativamente menor. Su enfoque de post-entrenamiento sobre un modelo abierto de gran escala demuestra que es posible obtener rendimiento de frontera sin partir de cero.
Aunque su naturaleza cerrada (sin pesos abiertos ni API independiente) limita su adopción fuera del ecosistema Devin. La compañía apuesta así por integrar el modelo en su propio agente de codificación, donde puede controlar la experiencia completa y monetizar el acceso a través de sus planes de pago.
Descubre más desde CIBERED
Suscríbete y recibe las últimas entradas en tu correo electrónico.


