Cognition lanza SWE-2: un modelo de codificación post-entrenado desde Kimi K3 que iguala a Fable 5.1 en FrontierCode con un 64% menos de coste

Actualidad y herramientas de Inteligencia Artificial leídas en CIBERED tu blog de Informática y Tecnología en Español Favorito

El modelo, disponible únicamente dentro de Devin, introduce niveles de esfuerzo de razonamiento seleccionables y reduce drásticamente el número de pasos y el coste frente a su predecesor. No tiene pesos abiertos ni API independiente.

Cognition, la empresa detrás del agente de codificación Devin, ha presentado SWE-2, su modelo de codificación más capaz hasta la fecha. El modelo ha sido post-entrenado con aprendizaje por refuerzo (RL) a partir de Kimi K3, el modelo abierto de 2,8 billones de parámetros desarrollado por Moonshot AI. Según los datos publicados por la compañía, SWE-2 alcanza una puntuación del 50,0% en FrontierCode 1.1 Main, a solo un punto de Fable 5.1 (50,9%) pero con un coste un 64% inferior.

GPT-6 Astra ya está aquí: nuevas capacidades, benchmarks y cómo accederGPT-6 Astra ya está aquí: nuevas capacidades, benchmarks y cómo acceder

Se trata, además, del primer modelo de Cognition con niveles de esfuerzo de razonamiento seleccionables, todos ellos entrenados en una única ejecución de RL. La empresa afirma que su algoritmo de RL todavía encuentra margen sustancial sobre K3, añadiendo entre 5 y 6 puntos en numerosos benchmarks.

Disponibilidad limitada

SWE-2 no está disponible para su despliegue en infraestructura propia. No tiene pesos abiertos ni una API independiente. Funciona exclusivamente dentro de Devin: en las versiones Desktop y CLI por ahora, con Devin Web y Fusion en proceso de implementación. La compañía ofrece acceso gratuito para los niveles de pago hasta el 10 de octubre de 2026.

Google revoluciona Gmail, Docs y Keep con Gemini: ahora todo se hace por vozGoogle revoluciona Gmail, Docs y Keep con Gemini: ahora todo se hace por voz

Resultados en benchmarks

Cognition ha publicado una tabla comparativa con los resultados de SWE-2 frente a otros modelos. Los datos proceden de evaluaciones públicas cuando están disponibles; en caso contrario, cada modelo se ejecuta en su entorno nativo con el mejor esfuerzo posible.

BenchmarkSWE-2Kimi K3Grok 4.6Fable 5.1GPT-5.6 SolGPT-6 AstraSWE-1.7
FrontierCode 1.1 Main50,0%44,2%48,0%50,9%47,5%53,3%42,0%
DeepSWE 1.173,0%68,5%67,5%67,4%72,7%74,1%37,7%
Terminal-Bench 2.192,8%88,3%88,4%91,4%88,8%89,9%81,5%
Terminal-Bench 427,3%21,5%20,3%55,8%37,3%57,9%7,6%

SWE-2 lidera en Terminal-Bench 2.1 y supera a su base K3 en todas las filas. Cognition señala que se queda a unos pocos puntos de GPT-6 Astra con un coste cuatro veces menor. Su punto débil más evidente es Terminal-Bench 4, donde SWE-2 queda aproximadamente 30 puntos por detrás de Fable 5.1 y GPT-6 Astra. FrontierCode es un benchmark propio de Cognition, y todas las cifras de los rivales provienen de la evaluación realizada por la propia compañía.

Comportamiento del modelo: menos desvíos

SWE-1.7 tendía a explorar en exceso en tareas simples. SWE-2 aborda este problema mediante lo que Cognition denomina “exploración enfocada”. En FrontierCode 1.1 Main, la versión media de SWE-2 obtiene una puntuación superior a SWE-1.7 mientras realiza un 58% menos de turnos y cuesta un 81% menos. La media de pasos por ejecución se reduce de 127 (SWE-1.7) a 53 (medio), 80 (alto) y 98 (máximo). SWE-2 medio realiza su primera edición real tras una mediana de 18 pasos, frente a los 48 de SWE-1.7.

Alibaba venderá su división de videojuegos por 1.500 millones de dólares para acelerar su apuesta por la IAAlibaba venderá su división de videojuegos por 1.500 millones de dólares para acelerar su apuesta por la IA

El equipo de Cognition también informa de tres patrones de comportamiento: una cobertura de pruebas de extremo a extremo más sólida, mayor capacidad de recurso cuando una herramienta se bloquea y disciplina de verificación. Cuando se le cuestiona, el modelo vuelve a derivar sus conclusiones en lugar de reafirmarlas.

¿Cómo se entrenó?

El entrenamiento de SWE-2 introduce varias innovaciones técnicas:

  • Penalizaciones de coste informadas por el Pareto: La recompensa se define como R = S menos lambda por C, donde S es el éxito binario y C combina el coste de inferencia en dólares con el tiempo de rollout. Cognition demuestra que solo una penalización lineal hace que el objetivo de RL dependa exclusivamente del coste medio y la tasa de resolución. Cada nivel de esfuerzo tiene su lambda ajustada a la pendiente local de la curva de Pareto del modelo base.
  • Línea base de recompensa ponderada por longitud: La magnitud del gradiente correlaciona fuertemente con la longitud del rollout, por lo que la línea base del grupo se pondera por tokens. En pruebas de ablación, esto mantuvo más baja la divergencia KL entre inferencia y entrenamiento y estabilizó el entrenamiento sin coste computacional adicional.
  • Servicio de rollouts y numérica: Un retardador de prefill agrupa solicitudes cercanas, elevando el TPM por GPU y el TPS por petición entre un 10% y un 20%. La decodificación especulativa DSpark acelera los rollouts, con un modelo borrador reentrenado mediante SpecForge para longitudes de aceptación un 15% mayores y luego entrenado en línea junto con la política. Los kernels NVFP4 y FP8 con entrenamiento consciente de la cuantización mantienen bajo el uso de memoria y reducen el desajuste entre entrenamiento e inferencia por debajo de los niveles de SWE-1.7.
  • Datos: Cognition triplicó sus entornos de RL, añadió capas de seguimiento de instrucciones y construyó un mecanismo que utiliza puntos de control anteriores de SWE-2 para corregir falsos positivos y negativos en los verificadores.

Comprobaciones de fiabilidad

Cognition volvió a ejecutar dos evaluaciones de su estudio de fiabilidad de código abierto. En 145 preguntas políticamente sensibles sobre China, SWE-2 superó el 98,0% global: 99,8% en inglés, 95,2% en chino simplificado y 99,1% en chino tradicional. En una prueba de vulnerabilidad dependiente del contexto a través de distintos encuadres de cliente, ningún encuadre produjo un cambio estadísticamente significativo para ningún modelo.

DeepSeek retira V4 Pro menos de 24 horas después de su lanzamientoDeepSeek retira V4 Pro menos de 24 horas después de su lanzamiento

Conclusión

SWE-2 representa un avance notable para Cognition: un modelo que compite con los principales referentes del sector en varios benchmarks y lo hace con un coste significativamente menor. Su enfoque de post-entrenamiento sobre un modelo abierto de gran escala demuestra que es posible obtener rendimiento de frontera sin partir de cero.

Aunque su naturaleza cerrada (sin pesos abiertos ni API independiente) limita su adopción fuera del ecosistema Devin. La compañía apuesta así por integrar el modelo en su propio agente de codificación, donde puede controlar la experiencia completa y monetizar el acceso a través de sus planes de pago.

Vistas: 0

Descubre más desde CIBERED

Suscríbete y recibe las últimas entradas en tu correo electrónico.

Scroll al inicio