Genera la evidencia técnica que piden ISO 42001, el EU AI Act y NIST AI RMF: scores auditables de tus agentes de IA, sin código.
Los marcos de gobernanza de IA piden demostrar que el sistema es preciso, que no discrimina y que está supervisado por personas. Demostrar, no afirmar. Y eso exige medición: números, fechas y un registro que alguien externo pueda revisar.
65% vs 25%
de las organizaciones encuentra sesgo en sus agentes de IA, pero solo el 25% lo audita de forma activa. Tres de cada cuatro no miden lo que ya saben que falla.
MIT Sloan Management Review
37,65%
de las respuestas de modelos líderes contenía alguna forma de sesgo, según un benchmark académico. En decisiones sensibles, eso es riesgo directo.
Benchmark BEATS (arXiv, 2025)
Auditoría
Un auditor no evalúa tus intenciones: pide registros trazables, pruebas de equidad entre grupos, umbrales de aprobado y documentación técnica.
ISO 42001 · EU AI Act · NIST AI RMF
Conectas tu bot o tu agente (por URL o por API, sin escribir código) y lo evalúas con más de 15 evaluadores de IA, cada uno calibrado para una dimensión de calidad. Cada corrida deja registro.
Compara las respuestas del sistema entre grupos y reporta las disparidades detectadas. Mide el sesgo donde se vuelve observable: en lo que el sistema efectivamente responde.
Quién ejecutó, cuándo, sobre qué versión y con qué score. Un registro inmutable por corrida, que es exactamente lo que un auditor pide ver.
Qué se probó, con qué criterios y con qué resultado, en un formato que se adjunta a tu documentación técnica.
La derivación a una persona es una dimensión evaluada: medimos si tu agente escala cuando corresponde: un pedido explícito, un caso sensible o algo fuera de su alcance.
Captura real de la plataforma; los datos son de un espacio de pruebas.
ISO 42001, el EU AI Act y NIST AI RMF no son alternativas entre las que elegir: son capas que se superponen, y casi cualquier organización grande opera bajo varias a la vez. Esto es lo que pide cada una en materia de calidad y auditoría, y dónde ArtificialQA aporta.
El globo recorre los marcos solo. Elige uno para quedarte en él; el detalle aparece debajo.
Un sistema de gestión de IA formal y certificable: evaluación de impacto, controles definidos, persona en el circuito de decisión y monitoreo continuo, todo verificable por un auditor externo.
Está pasando de diferenciador a requisito: cada vez más equipos de compras exigen ver evidencia de un sistema formal de gobernanza de IA antes de firmar.
Es una ley, con multas de hasta 35 millones de euros o el 7% de la facturación global. Si tu sistema es de alto riesgo (crédito y servicios esenciales, empleo, salud, biometría, infraestructura crítica, educación, migración o justicia) aplican las obligaciones de los artículos 9 al 15: gestión de riesgos, gobernanza de datos, documentación técnica, registros trazables, transparencia, supervisión humana y niveles adecuados de precisión y robustez.
Las obligaciones de alto riesgo tienen como referencia agosto de 2026, con discusión abierta sobre posibles ajustes de plazos.
Varias de esas obligaciones no se cumplen con un documento: hay que demostrar comportamiento. El encaje más directo está en el Art. 14 (supervisión humana) y en los Art. 11-12 (documentación y registros).
En el resto, el aporte es parcial o de apoyo: el detalle, artículo por artículo, está abajo.
| Art. | Qué exige | Evidencia que obtienes | Aporte |
|---|---|---|---|
| Art. 9 Gestión de riesgos |
Identificar, evaluar y mitigar riesgos de forma continua a lo largo del ciclo de vida. | Historial de pruebas por riesgo identificado; resultados por dimensión en el tiempo; pruebas de regresión tras cada cambio. | Parcial |
| Art. 10 Datos y no discriminación |
Datos de entrenamiento y prueba relevantes, representativos y examinados por posibles sesgos. | Pruebas de equidad comparando resultados entre grupos. No gobernamos tus datos de entrenamiento, pero sí medimos el sesgo en las respuestas. | Parcial |
| Art. 11 Documentación técnica |
Elaborar y mantener documentación técnica que demuestre el cumplimiento. | Reportes de evaluación exportables: qué se probó, cómo, con qué criterios y con qué resultado, versionado. | Directo |
| Art. 12 Registros (logs) |
Registro automático de eventos a lo largo del ciclo de vida del sistema. | Historial inmutable de ejecuciones, con registro por corrida y trazabilidad de qué versión se evaluó y cuándo. | Directo |
| Art. 13 Transparencia |
El sistema debe ser lo bastante transparente para que quien lo despliega interprete su salida. | Pruebas de que tu agente informa sus límites y no afirma con seguridad lo que no sabe. | De apoyo |
| Art. 14 Supervisión humana |
El sistema debe poder ser supervisado por personas, con capacidad de intervenir. | Tasa de derivación correcta a un humano y casos de escalamiento documentados. | Directo |
| Art. 15 Precisión y robustez |
Niveles adecuados de precisión y robustez, sostenidos de forma consistente en el tiempo. | Métricas de precisión y consistencia, más monitoreo continuo para detectar degradación. No cubrimos la parte de ciberseguridad. | Parcial |
Formalmente no exige nada: es voluntario. En la práctica se volvió el estándar esperado en Estados Unidos y la base sobre la que se apoyan leyes estatales de IA (Colorado, Texas). Adoptarlo es también un argumento de defensa si algo sale mal.
Organiza el trabajo en cuatro funciones: gobernar, mapear los riesgos, medirlos y gestionarlos.
De las cuatro funciones, "Measure" es literalmente lo que hace una plataforma de evaluación. Es la que más organizaciones documentan y menos ejecutan, porque exige instrumentación real.
Brasil lleva la delantera con el PL 2338/2023: régimen basado en riesgo, con obligaciones de evaluación de riesgo, detección de sesgo y documentación para sistemas de alto riesgo, y multas de hasta el 2% de la facturación local. La supervisión es sectorial: el Banco Central para la IA financiera, la ANS para salud.
Chile, México, Colombia y Perú tienen proyectos avanzados, todos con obligaciones de evaluación, calidad de datos y detección de sesgo. Y el EU AI Act se está volviendo la referencia: alinearte con él te abre Europa y te adelanta a la regulación local.
Brasil regula primero banca, salud y seguros. Justo ahí, un agente que inventa una tasa o no deriva a un médico ya no es solo un problema de calidad: es un problema regulatorio.
Son también los sectores que la regulación toma primero: los que administran dinero, salud o derechos de las personas.
Un agente que inventa una tasa, un plazo o un saldo genera un reclamo y, si hubo decisión de crédito, un problema de no discriminación. Alto riesgo en el Anexo III del EU AI Act y bajo la mira del Banco Central en Brasil.
Lo crítico no es solo la precisión: es la derivación segura. Que el agente reconozca un síntoma de alarma y pase a un profesional. Eso es exactamente lo que medimos como supervisión humana.
Atención a la ciudadanía con estándares de equidad, transparencia y rendición de cuentas más exigentes que en el sector privado, y con obligación de explicar cada decisión.
Responde cuatro preguntas sobre tu sistema y descubre, a modo orientativo, en qué categoría caerías y qué obligaciones de calidad tendrías que demostrar. Menos de un minuto y sin dejar datos.
Orientativo, no es asesoría legal. Basado en el Reglamento (UE) 2024/1689.
No. ArtificialQA te ayuda a generar la evidencia técnica que el proceso de certificación requiere: mediciones de calidad, historial auditable de cada ejecución y reportes exportables. La certificación la emite un organismo acreditado después de auditar tu sistema de gestión de IA, y hay pasos (políticas, roles, evaluación de impacto) que están fuera de nuestro alcance.
Aporta evidencia técnica de calidad para varias obligaciones de alto riesgo, con encaje más directo en el Art. 14 (supervisión humana) y los Art. 11-12 (documentación y registros). No reemplaza la evaluación de conformidad ni constituye asesoría legal: la clasificación de tu sistema y el expediente completo los gestiona tu organización con asesores legales.
No. Conectas tu bot o tu agente por URL o por API y diseñas las pruebas desde la interfaz. Está pensado para que lo operen equipos de calidad o de cumplimiento, no solo desarrolladores.
Con un evaluador dedicado que compara las respuestas del sistema entre grupos y reporta las disparidades detectadas. Medimos el sesgo en los resultados, que es donde el problema se vuelve observable y auditable, no en los datos de entrenamiento.
Cada ejecución queda en un historial inmutable con registro de qué se evaluó y cuándo, y los reportes son exportables. Además ArtificialQA calibra a sus evaluadores de IA contra criterio experto (verifica que los puntajes coincidan con lo que diría un especialista) y es agnóstico de modelo y proveedor: una verificación independiente pesa más que la autoevaluación de quien construyó el sistema.
En 30 minutos conectamos tu bot o tu agente y te mostramos qué se mide, qué queda registrado y cómo se exporta la evidencia.
Ideas, guías y buenas prácticas sobre testing y calidad de IA.
Aviso. Este material es informativo y no constituye asesoría legal ni regulatoria. El encaje descrito entre ArtificialQA y cada marco es técnico-funcional, no una opinión jurídica. ArtificialQA no certifica el cumplimiento del EU AI Act, de la ISO/IEC 42001 ni de ninguna otra norma, y no reemplaza la evaluación de conformidad: genera evidencia técnica de calidad que alimenta parte de esas obligaciones. Cada organización debe validar las suyas con asesores legales. Basado en el Reglamento (UE) 2024/1689, la ISO/IEC 42001 y el NIST AI RMF; plazos y detalles pueden variar, verifica el estado vigente. Datos de terceros citados con su fuente; cifras de producto ilustrativas. Julio de 2026.