Saltar al contenido
Iria Monitor

WHITEPAPER · ABRIL 2026

El gap de medición.

Un framework para observabilidad de código IA en empresas

Para CTOs, VPs de Ingeniería y CIOs responsables de los resultados de la inversión en IA.

  • 93,9%la IA frontier supera a los humanos (SWE-bench)
  • 42%de todo el código es ahora generado por IA
  • 0%de las orgs puede atribuir código IA por agente

Sección 1

Resumen ejecutivo

El 42% de todo el código entregado es ahora generado por IA[1]. Los últimos modelos frontier ya obtienen un 93,9% en SWE-bench Verified — superando a los desarrolladores humanos en la resolución de bugs reales de producción[2]. Sin embargo, prácticamente ninguna organización puede decirte qué agente escribió qué línea, ni si ese código sobrevivió una semana en producción. El gap no es la tecnología — es la ausencia de observabilidad.

Las plataformas de inteligencia de ingeniería estándar (DX, LinearB, Faros) miden actividad a nivel de equipo: cycle time, frecuencia de despliegues, velocidad de PRs. Ninguna mide qué fracción de un commit fue escrita por IA, qué agente la produjo, ni si ese código sobrevive en producción.

Sin atribución por línea, tres preguntas críticas quedan sin responder:

Este paper propone un framework de medición basado en tres KPIs (Adopción, Durabilidad, Reescritura de código) y un estándar abierto (git-ai v3.0.0) para capturar atribución IA por línea en el momento del commit. El enfoque es local-first, portable entre proveedores, y compatible con las plataformas de inteligencia de ingeniería existentes.

¿Cuánto del código que entregamos lo escribió una IA?

¿Ese código sobrevive — o genera retrabajo?

¿Qué proveedores y equipos usan IA con más eficacia?

Sección 2

El estado de la codificación IA en 2026

La codificación IA ya no es un piloto — es infraestructura de producción. El 42% de todo el código es ahora generado por IA[3]. Los modelos frontier superan a los desarrolladores humanos en resolución de bugs reales. La pregunta ya no es "¿deberíamos usar IA?" sino "¿qué IA, y cómo lo demostramos?"

  • 93,9% — SWE-bench Verified — IA frontier vs 67–70% baseline humano[4]
  • 90% — del Fortune 100 ha desplegado GitHub Copilot[5]
  • 3–4x — productividad en Goldman Sachs con coding IA agéntico[6]
  • 42% — de todo el código es ahora generado o asistido por IA[3]
  • 280K — horas de desarrollador ahorradas por DevGen.AI de Morgan Stanley en 5 meses[7]
  • $7,6B — mercado de herramientas de código IA en 2025 — proyectado $26B para 2030[8]

Sección 2b

Adopción empresarial por sector

Las herramientas de código con IA ya no son pilotos experimentales. Son infraestructura de producción en las mayores organizaciones del mundo. El 90% del Fortune 100 ha desplegado solo GitHub Copilot[9]. Pero la profundidad de adopción varía dramáticamente por sector.

Adopción de herramientas de código IA por sector, 2026

Fuentes: GitHub Blog, JetBrains 2025, informes públicos, GOV.UK AICA trial

Fuentes: GitHub Blog, JetBrains 2025, informes públicos, GOV.UK AICA trial
SectorAdopción
Fortune 10090%
Tecnología / SaaS85%
Banca78%
Gobierno45%
Todos los desarrolladores82%
Fortune 500: Adopción universal, resultados desiguales
Accenture desplegó Copilot a 50.000 desarrolladores y midió un 84% de aumento en builds exitosas, merges de PR un 50% más rápidos y lead times un 55% más cortos[9]. Salesforce alcanzó un 90% de adopción de Cursor en 20.000 ingenieros[10]. Microsoft adoptó internamente Claude Code en equipos de ingeniería clave[10]. La escala de adopción ya no está en duda — la pregunta es si las organizaciones pueden medir los resultados.
Banca: Miles de millones invertidos, la medición es obligatoria
JPMorgan Chase tiene más de 200.000 empleados en su LLM Suite con una inversión de $2.000M en IA que genera un 40–50% de mejora de productividad en operaciones[11]. Goldman Sachs desplegó Devin (ingeniero IA autónomo) a 12.000 desarrolladores, reportando productividad 3–4x en codificación y debugging[12]. Morgan Stanley construyó DevGen.AI internamente, procesando 9 millones de líneas de código y ahorrando 280.000 horas a 15.000 desarrolladores en 5 meses[13]. Citigroup dotó de herramientas IA a 30.000 desarrolladores, midiendo un 9% de mejora en productividad[14]. Los bancos no se preguntan si adoptar — se preguntan cómo auditar.
Gobierno: 3 millones de usuarios, cero observabilidad
El Pentágono lanzó GenAI.mil en diciembre 2025, desplegando IA a 3 millones de empleados y contratistas[15]. Una licitación separada del DoD (febrero 2026) busca herramientas de código IA para decenas de miles de desarrolladores, requiriendo FedRAMP High e IL5[16]. El gobierno del Reino Unido realizó una prueba formal en 50 organizaciones y midió 56 minutos ahorrados por desarrollador al día[17]. Gartner predice que el 80% de los gobiernos desplegarán agentes IA para 2028[18]. La adopción está ocurriendo. La infraestructura de medición no existe aún.

Sección 2c

Lo que dicen los analistas

Todas las grandes firmas de analistas han publicado sobre IA en ingeniería de software. El consenso: la adopción es inevitable, pero la medición y la gobernanza van peligrosamente por detrás.

Trayectoria de adopción y proyecciones de mercado

  • 14%Ingenieros enterprise — usando IA (Gartner) (2024)
  • 82%Desarrolladores usan IA — semanalmente (JetBrains) (2026)
  • 90%Predicción Gartner: — adopción enterprise (2028)
  • 80%Equipos más pequeños — aumentados con IA (Gartner) (2030)
  • $7.6BMercado AI code tools — (2025)
  • $26BMercado proyectado — (2030, 27% CAGR)
  • $91BMercado proyectado — (2035, Precedence)

Fuentes: Gartner, Grand View Research, Precedence Research, JetBrains 2025

La paradoja de la productividad (DORA 2025)

MÉTRICAS INDIVIDUALES (SUBEN)

  • +21%tareas completadas
  • +42%código generado por IA
  • +98%PRs mergeadas
  • 30–60%tiempo ahorrado codificando

MÉTRICAS ORG (PLANAS / BAJAN)

  • 0%mejora en entregas
  • 4xduplicación de código
  • −7.2%estabilidad de entregas
  • 2xreescritura de código (proyección 2026)

Fuentes: DORA Report 2025, Sonar Developer Survey, ByteIota 2026

Gartner Hype Cycle for AI in Software Engineering, 2025
"Para 2028, el 90% de los ingenieros de software enterprise usarán asistentes de código IA, frente a menos del 14% a principios de 2024. Para 2030, el 80% de las organizaciones transformarán equipos grandes en unidades más pequeñas aumentadas con IA."
McKinsey, 'The AI Revolution in Software Development', 2025
"El impacto de la IA en la productividad de ingeniería de software: 20 a 45% del gasto anual actual. Los mejores rendimientos muestran un 16–30% de mejora en productividad de equipo y un 31–45% de mejora en calidad de software."
DORA Report 2025 (Google, ~5.000 profesionales encuestados)
"Los desarrolladores completaron un 21% más de tareas y mergearon un 98% más de pull requests — pero las métricas de entrega organizacional se mantuvieron planas. La IA actúa como amplificador: magnifica las fortalezas de los equipos de alto rendimiento Y las disfunciones de los que tienen problemas."
BCG, 'Are You Generating Value from AI?', 2025
"El 60% de las organizaciones no generan valor material de la IA a pesar de las inversiones. Solo el 5% crea valor sustancial a escala. La brecha no es la tecnología — es la capa de gestión."

Sección 2d

El imperativo regulatorio

La presión regulatoria converge sobre el código generado por IA desde tres direcciones: el EU AI Act, el compliance financiero (SOX/SOC 2) y los mandatos emergentes de calidad de código. Las organizaciones que no puedan identificar qué código fue generado por IA enfrentarán hallazgos de auditoría, brechas de compliance y bloqueos de contratación en los próximos 18 meses.

Cronograma de aplicación del EU AI Act

ESTÁS AQUÍ

  1. Febrero de 2025Febrero de 2025 — Prácticas prohibidas — EU AI Act
  2. Agosto de 2025Agosto de 2025 — Reglas modelos GPAI — aplican
  3. Agosto de 2026Agosto de 2026 — Aplicación completa — Transparencia + marcado
  4. Agosto de 2027Agosto de 2027 — Sistemas alto riesgo — compliance completo
EU AI Act: Obligaciones de transparencia para contenido generado por IA
El EU AI Act se aplica completamente el 2 de agosto de 2026. Las reglas de transparencia exigen que los proveedores de IA generativa aseguren que el contenido generado por IA sea identificable. Aunque las herramientas de código no se clasifican como alto riesgo por defecto, el código generado por IA que entre en productos regulados (dispositivos médicos, automoción, infraestructura crítica) queda bajo las obligaciones de alto riesgo desde agosto 2027[19]. La Comisión Europea publicó su primer borrador de Código de Prácticas sobre marcado de contenido IA en diciembre 2025.
SOX: Pistas de auditoría para código generado por IA en industrias reguladas
En banca, donde SOX exige pistas de auditoría y PCI DSS requiere validación de seguridad de pagos, el 29–48% del código generado por IA puede contener debilidades de seguridad[20]. El código IA sin testear puede crear violaciones de compliance con penalizaciones financieras significativas. Los pipelines CI/CD deben producir pistas de auditoría completas: hash del commit, resultados de tests, registros de aprobación, logs de despliegue. La atribución por línea de IA es la pieza que falta de esta cadena de auditoría.
SOC 2: La integridad del modelo IA ya está en alcance
La guía AICPA 2026 vincula CC9.2 (Operaciones del Sistema) directamente a la integridad del modelo IA: monitoreo de deriva del modelo, bloqueo de inyección de prompts, mantenimiento de linaje inmutable de todos los datos de entrenamiento y versiones de modelo[21]. La calidad de la evidencia determina el 80% de los resultados de auditoría. El monitoreo continuo ha reemplazado la recolección periódica de evidencia. Las organizaciones que usan herramientas de código IA sin datos de atribución tienen una brecha en su cadena de evidencia SOC 2.
2025 vs 2026: La historia de calidad se ha invertido — con los modelos adecuados
En 2025, los datos agregados pintaban un panorama preocupante: Veracode encontró 2,74x más vulnerabilidades en código generado por IA[22], CodeRabbit reportó 1,7x más incidencias en PRs con código IA[23]. Pero esos números medían todos los modelos — incluido autocompletado básico aceptando sugerencias sin revisión. En abril 2026, la trayectoria se invirtió. Claude Mythos Preview de Anthropic obtuvo 93,9% en SWE-bench Verified, superando dramáticamente a los desarrolladores humanos (67–70%) en la resolución de bugs reales de producción[24]. A través de Project Glasswing, el modelo encontró una vulnerabilidad de 27 años en OpenBSD y un fallo de 16 años en FFmpeg que sobrevivió a 5 millones de ejecuciones de tests automatizados[25]. La IA frontier ya no es la fuente de vulnerabilidades — es la herramienta que las encuentra. La pregunta ya no es si la IA produce código seguro, sino qué IA. Los reguladores no harán esa distinción a menos que las organizaciones puedan demostrar, por commit, qué agente escribió qué código. La atribución es lo que separa "la IA es un riesgo" de "la IA es nuestra capa de seguridad más fuerte."

Sección 3

El gap de medición

Las organizaciones de ingeniería llevan una década invirtiendo en plataformas de medición. Métricas DORA, framework SPACE, scores DXI. Ninguna mide la autoría IA.

Solo el 16,8% de las organizaciones rastrea inversión por herramienta IA frente a beneficio[8]. Del 83,2% restante, la mayoría confía en encuestas a developers, feedback anecdótico, o ninguna medición. Cuando el board pregunta si el presupuesto de IA está dando resultado, la respuesta honesta es "no lo sabemos".

Qué miden las plataformas actuales
Categoría de plataformaQué rastrea¿Mide IA?
Engineering intelligence (DX, LinearB, Faros)Cycle time, throughput, velocidad de PRs, DORANo
Calidad de código (SonarQube, Code Climate)Análisis estático, cobertura de tests, complejidadNo
Gateways IA (proxies LLM)Consumo de tokens, coste de APISolo entradas
Encuestas a developersSatisfacción auto-reportadaSubjetivo
Observabilidad de código IA (Iria Monitor, git-ai)Atribución por línea, durabilidad, reescrituraSí

El gap no está en los datos — git ya almacena todo lo necesario. El gap está en capturar la autoría IA en el momento de la creación, antes de que la señal desaparezca.

Sección 4

Un framework para observabilidad de código IA

El framework se basa en tres principios:

1. Captura en origen, no a posteriori
Los agentes IA (Claude Code, Cursor, Codex, Windsurf) emiten hooks PreToolUse y PostToolUse cuando editan archivos. Capturar el diff en ese momento es determinista. La detección a posteriori (clasificadores IA sobre diffs) tiene <60% de precisión.
2. Persiste como metadatos nativos de git
Los datos de atribución se almacenan en refs/notes/ai como git notes estructuradas siguiendo el estándar abierto git-ai v3.0.0. Los datos viajan con el código, sobreviven a rebases vía post-rewrite hooks, y son accesibles a cualquier herramienta que lea git.
3. Agrega sin enviar código fuente
Solo metadatos salen de la máquina del developer: números de línea, identificadores de agente, nombres de modelo, timestamps. El código fuente nunca se transmite. Las revisiones de compliance se pasan el primer día.
Arquitectura
  1. MÁQUINA DEL DESARROLLADOR
  2. Agentes IA
  3. Claude Code · Cursor
  4. Codex · Windsurf
  5. hooks
  6. iria-monitor CLI
  7. calcula el diff
  8. atribuye líneas
  9. refs/notes/ai
  10. git-ai v3.0.0
  11. estándar abierto
  12. git push (solo metadatos, sin código fuente)
  13. IRIA MONITOR CLOUD · OPCIONAL
  14. Agregación
  15. · Por proveedor
  16. · Por repositorio
  17. · Por desarrollador (privado)
  18. KPIs
  19. Adopción
  20. Durabilidad
  21. Reescritura de código
  22. Exportar
  23. PDF · CSV · BI
Comparativa enterprise de proveedores con Acme Consulting en estado Sólido y TechForge Ltd en Riesgo para los KPIs de Adopción, Durabilidad y Reescritura de código
Figura 1: Comparativa enterprise de proveedores (datos demo de IriaBank)

Sección 5

Tres KPIs que importan

La atribución por línea es la base, pero el valor viene de tres métricas derivadas. Estos son los números que un CTO debería poder recitar para cualquier trimestre, repositorio o proveedor.

Adopción
% de líneas de código atribuidas a agentes IA en un periodo dado
Adoption = (lines AI-attributed) / (total lines added) × 100

La adopción por sí sola no es una métrica de calidad. Un proveedor al 80% de IA puede estar funcionando mejor o peor que uno al 30%. El valor de la Adopción es contextual: establece el denominador para los otros dos KPIs.

Benchmark de la industria: Los equipos saludables operan entre el 25–40%. Por encima del 40%, las tasas de retrabajo aumentan 20–25%[7].

Durabilidad
% de líneas IA atribuidas que siguen presentes en HEAD tras N días
Durability(30d) = (AI lines unchanged 30 days later) / (AI lines added) × 100

La métrica más importante. La durabilidad separa el código IA valioso del retrabajo. Una línea que sobrevive 30 días en producción mereció ser generada. Una línea reescrita la misma semana no — consumió tokens, tiempo de revisión y confianza.

Por qué importa: Dos proveedores con 70% de Adopción pueden tener resultados muy diferentes. Uno con 90% de Durabilidad está aportando valor. Uno con 55% está generando retrabajo que pagas dos veces.

Reescritura de código
% de líneas IA reescritas por humanos en N días
Churn(7d) = (AI lines rewritten by human within 7 days) / (AI lines added) × 100

La reescritura de código es la señal inversa de Durabilidad y el indicador adelantado de problemas. Una reescritura alta significa que los humanos están corrigiendo sistemáticamente el output IA. Apunta a elección de herramienta equivocada, prompts equivocados, o domain fit equivocado.

Valor diagnóstico: La reescritura segmentada por agente revela si el problema es la herramienta (Cursor 18% vs Claude 6% en el mismo repo) o el developer (un equipo 4%, otro 22% con el mismo agente).

Detalle de Dave Kumar de Acme Consulting con 90% de durabilidad, 10% de reescritura y 65% de uso de Claude Code
Dave Kumar (Acme) — 90% de durabilidad, 10% de reescritura
Detalle de Grace Park de TechForge con 55% de durabilidad, 45% de reescritura y 53% de uso de Copilot
Grace Park (TechForge) — 55% de durabilidad, 45% de reescritura

Figura 2: La misma empresa, dos proveedores, resultados diferentes (datos demo de IriaBank)

Sección 6

Camino de implementación

La observabilidad de código IA no requiere un nuevo SDLC. Es una capa añadida sobre los repositorios existentes sin alterar el flujo del developer.

  1. Semana 1 — Piloto en un solo repositorioInstala el CLI en las máquinas de tres ingenieros. Confirma que los hooks se disparan en cada commit. Valida que las git notes aparecen en refs/notes/ai.
  2. Semana 2 — Conecta el dashboardInstala la GitHub App. Verifica que los commits pusheados aparecen con su atribución. Establece el baseline de Adopción / Durabilidad / Reescritura de código para el repo piloto.
  3. Semanas 3–4 — Despliegue a un equipoOnboarding de un equipo de ingeniería completo. Compara métricas por developer en privado. Identifica patrones de alta Durabilidad y alta reescritura de código para hacer coaching.
  4. Mes 2 — Visibilidad por proveedorPara organizaciones con proveedores externos, invítalos como proveedores de datos. Establece una cadencia trimestral de revisión con los KPIs como agenda.
  5. Trimestre 1 — Report listo para boardPrimer report trimestral con tres números: Adopción, Durabilidad, Reescritura de código. Línea de tendencia. Comparativa de proveedores. El report que tu CFO lleva tiempo pidiendo.
Vista blame línea a línea que muestra la atribución de claude-code, cursor y personas en líneas individuales de código fuente
Figura 4: Atribución línea a línea — determinista, no probabilística (datos demo de IriaBank)

Sección 7

Escenario ilustrativo

El siguiente escenario es ilustrativo y se basa en patrones observados en investigación de la industria 2026. Los nombres están anonimizados.

Un banco minorista europeo contrata a dos consultoras para entregar una nueva plataforma de banca móvil. Ambos proveedores cobran tarifas equivalentes por developer. Tras Q1, el equipo de procurement del banco solicita datos de atribución de código IA a ambos proveedores.

Banco europeo · Revisión de procurement con dos proveedores
ProveedorAdopciónDurabilidad (30d)Reescritura de código (7d)
Proveedor A68%91%4%
Proveedor B82%58%23%

La lectura: El Proveedor B usa IA más agresivamente (82% vs 68%) pero produce código que se reescribe casi una cuarta parte del tiempo. El banco paga tanto la generación original como el retrabajo. El Proveedor A usa menos IA pero con resultados sustancialmente mejores.

La conversación que sigue: El banco no necesita rescindir al Proveedor B. Con estos datos, puede hacer preguntas concretas: qué agentes se están usando, en qué tipos de archivo, por qué equipos. Los datos convierten una preocupación vaga en una discusión estructurada de procurement.

Comparativa de proveedores con Acme Consulting en estado Sólido y TechForge Ltd en Riesgo, con KPIs de toda la empresa
Figura 3: La comparativa de proveedores que guía la conversación de procurement (datos demo de IriaBank)

Sección 8

Conclusión

Las herramientas de codificación IA no son el problema. La ausencia de medición lo es. Los presupuestos enterprise han crecido más rápido que los instrumentos para evaluar su retorno.

El framework propuesto en este paper es intencionadamente mínimo: tres KPIs, un estándar abierto, sin transmisión de código fuente. Complementa, no reemplaza, las plataformas de inteligencia de ingeniería existentes. Produce números que un CTO puede llevar a una reunión de board y un equipo de procurement puede llevar a una revisión de proveedor.

Las empresas que adopten esta capa en 2026 serán las que puedan responder, en doce meses, la única pregunta que importa: ¿la inversión en IA salió rentable?

Apéndice

El estándar abierto

Iria Monitor implementa la especificación git-ai v3.0.0, un estándar abierto para atribución de código IA almacenada como git notes en refs/notes/ai. El formato es legible por humanos, versionado, y portable entre herramientas.

Las organizaciones que adoptan el estándar conservan portabilidad total de datos. Si es necesario un cambio de herramienta por cualquier razón, los datos de atribución subyacentes son independientes de la plataforma analítica que los lea. Es el mismo principio que hizo de OpenTelemetry el estándar de facto para instrumentación de observabilidad: los datos sobreviven al proveedor.

Para la especificación técnica, ver github.com/git-ai-project/git-ai.

Referencias

Fuentes

  1. [1] Sonar Developer Survey 2026 & NetCorp, AI-Generated Code Statistics 2026. El 42% de todo el código es ahora generado o asistido por IA.
  2. [2] Anthropic, Claude Mythos Preview, abril 2026. 93,9% SWE-bench Verified; baseline de desarrolladores humanos 67–70%.
  3. [3] Sonar Developer Survey 2026 & NetCorp, AI-Generated Code Statistics 2026. El 42% de todo el código es ahora generado o asistido por IA.
  4. [4] Anthropic, Claude Mythos Preview, abril 2026. 93,9% SWE-bench Verified; baseline humano 67–70%. Análisis de benchmarks MindStudio.
  5. [5] GitHub Blog, Research: Quantifying GitHub Copilot's Impact with Accenture, 2025. Despliegue de 50.000 desarrolladores. 90% del Fortune 100 según Satya Nadella, julio 2025.
  6. [6] Lucidate, Goldman Sachs Scales AI Coding to Thousands of Agents, 2026. 12.000 desarrolladores, productividad 3–4x con ingeniero autónomo Devin.
  7. [7] Entrepreneur, Morgan Stanley Created an AI Tool That Saves Developers 280,000 Hours. DevGen.AI procesó 9M líneas de código en 15.000 desarrolladores en 5 meses.
  8. [8] Grand View Research & Precedence Research. Mercado AI code tools: $7,65B (2025), proyectado $26B (2030, 27% CAGR), $91B (2035).
  9. [9] GitHub Blog, Research: Quantifying GitHub Copilot's impact in the enterprise with Accenture, 2025. Despliegue de 50.000 desarrolladores; 84% más builds exitosas.
  10. [10] TechResearchOnline, Anthropic Enterprise AI Adoption Gains Momentum in 2026. 90% de adopción de Cursor en Salesforce; adopción de Claude Code en Microsoft.
  11. [11] AIX Network, Case Study: JPMorgan Chase AI. 200.000+ usuarios LLM Suite, inversión de $2.000M, 40–50% productividad en operaciones.
  12. [12] Lucidate, Goldman Sachs Scales AI Coding to Thousands of Agents, 2026. 12.000 desarrolladores, productividad 3–4x con Devin.
  13. [13] Entrepreneur, Morgan Stanley Created an AI Tool That Saves Developers 280,000 Hours. DevGen.AI, 9M líneas de código en 5 meses.
  14. [14] Banking Dive, Citi eyes AI productivity gains. 30.000 desarrolladores, 9% de mejora de productividad vía Google Cloud Vertex AI.
  15. [15] DefenseScoop, DOD initiates large-scale rollout of commercial AI models, diciembre 2025. GenAI.mil: 3 millones de usuarios.
  16. [16] DefenseScoop, DOD wants AI-enabled coding tools for developer workforce, febrero 2026. Requisitos FedRAMP High + IL5.
  17. [17] GOV.UK, AI coding assistant trial: UK public sector findings report, 2025. 50 organizaciones, 56 min/día ahorrados, 58% no volvería atrás.
  18. [18] Gartner, 80% of Governments Will Deploy AI Agents by 2028, marzo 2026.
  19. [19] Comisión Europea, EU AI Act. Aplicación completa 2 de agosto de 2026. Obligaciones de transparencia + compliance de sistemas de alto riesgo desde agosto 2027.
  20. [20] Virtuoso, Testing AI Generated Code in Regulated Industries, 2025. 29–48% debilidades de seguridad en código IA; implicaciones SOX/PCI DSS.
  21. [21] Baker Tilly, Evolving SOC 2 reports for AI controls, 2026. CC9.2 vinculado a integridad de modelo IA; 80% de resultados de auditoría dependen de calidad de evidencia.
  22. [22] Veracode, GenAI Code Security Report, 2025. Código IA tiene 2,74x más vulnerabilidades. 100+ LLMs probados en 4 lenguajes.
  23. [23] CodeRabbit, 2025 was the year of AI speed. 2026 will be the year of AI quality. 1,7x más incidencias en PRs con código IA (470 PRs analizados).
  24. [24] Anthropic, Claude Mythos Preview, abril 2026. 93,9% SWE-bench Verified (baseline humano 67–70%). MindStudio, Claude Mythos Benchmark Results.
  25. [25] Anthropic, Project Glasswing: Securing critical software for the AI era, abril 2026. Vulnerabilidad de 27 años en OpenBSD, fallo de 16 años en FFmpeg que sobrevivió 5M ejecuciones de tests. $100M en créditos comprometidos.

Construye tu capa de medición.

Iria Monitor es la implementación de referencia del framework descrito en este paper. Gratis para developers individuales. Por usuario para equipos. Custom para enterprise.

Ver el coach personal

Lleva el mismo marco al loop individual — local, leading, sin ranking.