Gobernanza, compliance y regulación de la IA agéntica
AI Act, NIST AI RMF, model risk management y evidencia auditable para sistemas agénticos.
Objetivos de aprendizaje
- Situar el estado real de la regulación de IA aplicable a agentes de trading a julio de 2026, distinguiendo norma vigente, propuesta retirada y práctica emergente en EE. UU., UE y Reino Unido.
- Explicar qué cambió con SR 26-2 (17-abr-2026) frente a SR 11-7, por qué la exclusión explícita de la IA generativa y agéntica crea un vacío de gobernanza, y qué principios de la doctrina clásica de model risk management persisten como buena práctica examinable.
- Reconstruir los casos de enforcement por AI washing (Delphia, Global Predictions, Rimar Capital) con firma, fecha, importe y base legal, y extraer la doctrina: la Marketing Rule y el deber fiduciario ya bastan para sancionar.
- Aplicar los precedentes judiciales sobre alucinaciones (Moffatt v. Air Canada, Mata v. Avianca) y el régimen de record-keeping 17a-4 a las comunicaciones y trazas generadas por agentes.
- Diseñar los artefactos mínimos de gobernanza de un fondo: política de uso de IA (matriz datos × modelo), inventario de agentes, trazas inmutables, matriz de escalado human-in-the-loop y evidencia de auditoría.
- Justificar regulatoriamente por qué los patrones de los módulos 3 (HITL) y 9 (RiskGateway) son obligatorios y no opcionales.
Los módulos anteriores construyeron la arquitectura; este responde a la pregunta restante: quién exige todo eso, y qué ocurre si falta. La respuesta, a julio de 2026, es paradójica: en EE. UU., el marco clásico de gestión de riesgo de modelos acaba de excluir deliberadamente a la IA generativa y agéntica de su ámbito, mientras la SEC sanciona con las reglas de siempre; en la UE, el AI Act acaba de aplazar su régimen de alto riesgo dieciséis meses, pero ESMA exige ya que la IA entre en la autoevaluación anual del trading algorítmico. El hilo conductor es uno solo: la responsabilidad no se delega —ni al modelo, ni al proveedor, ni al chatbot (BuilderWorld) .
10.1 El mapa regulatorio en julio de 2026
10.1.1 SR 26-2: la rescisión de SR 11-7 y el vacío de gobernanza
Durante quince años, la carta SR 11-7 de la Reserva Federal (4-abr-2011, con sus paralelas OCC 2011-12 y FDIC FIL-22-2017) fue la referencia operativa del model risk management estadounidense: definición amplia de "modelo", tres pilares (desarrollo; validación independiente con conceptual soundness, monitoreo continuo y análisis de resultados; gobernanza con inventario, tiering y effective challenge) y cobertura explícita de modelos de terceros —"lo compramos, no lo construimos" nunca fue una defensa (paperswithbacktest.com) .
El 17 de abril de 2026, Fed, OCC y FDIC publicaron la guía revisada —SR 26-2 / OCC Bulletin 2026-13— que sustituye y rescinde SR 11-7 y SR 21-8 (Pinecone) . Cambios materiales: definición de "modelo" más estrecha; exclusión explícita de la IA generativa y agéntica del ámbito; umbral de relevancia plena de $30{,}000 millones de activos; validación ligada a materialidad y no a calendarios anuales; régimen simplificado para modelos de vendor; y un disclaimer expreso —el incumplimiento de la guía, por sí solo, no genera crítica supervisora (Pinecone) .
La consecuencia es un vacío de gobernanza documentado: prompts con PII de clientes, MNPI, términos confidenciales y estrategias propietarias fluyen hoy hacia proveedores externos fuera de cualquier régimen de validación, de cualquier estructura formal de gobernanza y, con frecuencia, fuera del registro de auditoría; los sistemas agénticos que orquestan modelos tradicionales habitan directamente ese hueco (From Concepts to Korean Language Benchmarks) . Que la guía no sea exigible per se no equivale a impunidad: los examinadores siguen esperando un enfoque coherente del riesgo de IA, y las consecuencias aguas abajo permanecen en ámbito —si un componente generativo produce errores sistemáticos que alimentan precios, señales o estimaciones de pérdida esperada, esas salidas siguen perteneciendo al inventario de modelos (youngju.dev) . Para una gestora, además, SR 26-2 opera como estándar de facto en la due diligence de inversores institucionales y contrapartes bancarias.
Lo que persiste de SR 11-7 como buena práctica examinable es su esqueleto conceptual: inventario completo de casos de uso (incluido el shadow AI: Copilots y API keys personales son el hallazgo más citado en exámenes (MyEngineerPath) ), documentación, validación independiente con effective challenge documentado, monitoreo continuo y rendición de cuentas ante el consejo (paperswithbacktest.com) . El contraste con Reino Unido es instructivo: la PRA SS1/23 (mayo 2023), vigente, sí cubre explícitamente la IA —"incluyendo la gestión de los riesgos asociados al uso de IA en técnicas de modelado como el machine learning"— con responsabilidad asignada a una función directiva senior (SMF) nombrada (firecrawl.dev) . El mismo agente puede quedar fuera del perímetro de model risk en EE. UU. y dentro en el Reino Unido: una zona gris que la firma multi-jurisdicción debe resolver por diseño, no por omisión (Pinecone) .
Tabla 10.1 — Mapa regulatorio de la IA en trading y gestión de activos, por jurisdicción (estado a 29-jul-2026)
| Jurisdicción | Instrumento | Estado a jul-2026 | Implicación para agentes de trading |
|---|---|---|---|
| EE. UU. (banca) | SR 26-2 / OCC 2026-13 (Fed, OCC, FDIC) | Vigente desde 17-abr-2026; rescinde SR 11-7; excluye GenAI/IA agéntica; umbral $30{,}000 M; no vinculante per se (Pinecone) | Sin régimen de validación obligatorio para agentes, pero expectativa supervisora de gobernanza coherente; salidas aguas abajo en ámbito (From Concepts to Korean Language Benchmarks) |
| EE. UU. (valores) | SEC: Marketing Rule 206(4)-1, deber fiduciario, Reg BI; regla PDA de conflictos | Regla PDA retirada 17-jun-2025; no habrá regla final (BirJob) ; prioridades de examen 2026 incluyen IA explícitamente (mSightFlow) | Supervisión ex post: enforcement por AI washing y exámenes de coherencia disclosure–controles (Apify) |
| EE. UU. (broker-dealers) | FINRA Regulatory Notice 24-09 | Vigente desde 27-jun-2024; neutralidad tecnológica (Apify) | Todo el rulebook (Regla 3110 de supervisión) aplica a GenAI, incluidas herramientas de vendors (Apify) |
| EE. UU. (registros) | SEC Regla 17a-4 (enmendada oct-2022) | Vigente; WORM o pista de auditoría completa (OrbTop) | Outputs de LLM que sean comunicaciones de negocio —y sus prompts— deben preservarse; trazas como audit-trail (OrbTop) |
| UE | AI Act (Reglamento 2024/1689) + Digital Omnibus | Prohibiciones y alfabetización en vigor; Art. 50 (transparencia) desde 2-ago-2026; alto riesgo Anexo III aplazado a dic-2027 (Consejo, 29-jun-2026) (Parse) | El trading con IA no es "alto riesgo" hoy; obligaciones de transparencia y formación sí aplican (Docs by LangChain) |
| UE (trading algorítmico) | MiFID II Art. 17 + RTS 6 (Reglamento 2017/589); briefing ESMA 26-feb-2026 | Vigente; la IA debe integrarse en la autoevaluación anual RTS 6 (Docs by LangChain) | Responsabilidad plena e indelegable de la firma aunque use algoritmos de terceros; retesting ante cambios materiales acumulativos (Docs by LangChain) |
| UE (resiliencia TIC) | DORA (Reglamento 2022/2554) | En aplicación desde 17-ene-2025 (RavenPack) | Proveedores de LLM/cloud que soportan funciones críticas: registro de información, derechos de auditoría, estrategia de salida (RavenPack) |
| Reino Unido | PRA SS1/23 (mayo 2023) | Vigente; incluye IA explícitamente; responsabilidad asignada a un SMF (firecrawl.dev) | Agentes y LLMs usados en modelado entran en el perímetro de model risk con owner nombrado (firecrawl.dev) |
| Singapur | MAS: FEAT (2018), Veritas, Guidelines de riesgo de IA | Guidelines en consulta (cierre 31-ene-2026; finalización esperada en 2026) (nexusfi.com) | Gobernanza del ciclo de vida completo, proporcionalidad, controles específicos de GenAI (alucinación, prompt injection, HITL) (nexusfi.com) |
La tabla condensa la asimetría del momento: EE. UU. desregula en la forma (PDA retirada, SR 26-2 con carve-out y disclaimer) mientras supervisa en la práctica vía exámenes y enforcement; la UE regula ex ante pero aplazó la parte más dura del AI Act, dejando el peso real en el ancla sectorial MiFID II/RTS 6 y DORA; Reino Unido ocupa el punto medio con un marco que sí nombra a la IA. La lectura operativa: ninguna jurisdicción exime al sistema de gobernanza —donde no hay norma de validación hay enforcement por resultados, y donde la norma horizontal se aplaza la sectorial ya exige integrar la IA en la autoevaluación anual. La convergencia es el principio de responsabilidad indelegable; la divergencia está solo en el instrumento (ex ante frente a ex post), no en el resultado (BuilderWorld) .
En palabras llanas: un vacío de gobernanza no es una amnistía
Imagina que tu ciudad deja de exigir inspección estructural para un material de construcción nuevo. ¿Significa eso que puedes edificar como quieras? No: si el edificio se cae, la responsabilidad civil está intacta; la aseguradora seguirá exigiendo el estándar antiguo para darte póliza, y el banco no te financiará sin él. Eso es exactamente SR 26-2: elimina la obligación del régimen (validación formal de la IA agéntica), no la responsabilidad por los resultados.
Tres anclas concretas sobreviven a la rescisión, y conviene tenerlas presentes cada vez que alguien diga «ya no hace falta»:
- La expectativa examinadora: los equipos de supervisión siguen esperando un enfoque coherente del riesgo de IA, aunque la guía ya no sea exigible per se.
- Las salidas aguas abajo: si un componente generativo alimenta precios, señales o pérdida esperada, esas salidas siguen en el inventario de modelos.
- El estándar de facto: en la due diligence de inversores institucionales y contrapartes bancarias, SR 26-2 se usa como vara de medir aunque no obligue.
10.1.2 Europa: AI Act tras el Digital Omnibus, ESMA y la autoevaluación RTS 6
El AI Act (Reglamento (UE) 2024/1689) es, a julio de 2026, un calendario y no una foto. Ya son exigibles las prácticas prohibidas del Art. 5 y la alfabetización del Art. 4 (feb-2025) y las obligaciones de modelos de propósito general (ago-2025). En cuatro días —el 2 de agosto de 2026— entran en vigor las obligaciones de transparencia del Art. 50: todo chatbot que interactúe con personas (p. ej., atención a inversores) deberá revelar que es IA y el contenido sintético deberá ir marcado, con sanciones de hasta 15 millones de euros o el 3% de la facturación mundial (Parse) . El Digital Omnibus (adoptado por el Consejo el 29-jun-2026) aplazó el alto riesgo del Anexo III a diciembre de 2027 y el del Anexo I a agosto de 2028, pero dejó intacto el Art. 50 (Parse) .
El punto que más se confunde: el uso de IA en trading algorítmico no es hoy alto riesgo bajo el AI Act (el Anexo III sí cubre el credit scoring, relevante para gestoras con negocio de crédito), aunque ESMA advierte de que la clasificación se revisa anualmente (Docs by LangChain) . No ser alto riesgo no es estar desregulado: el ancla europea real es sectorial —Art. 17 de MiFID II y RTS 6 (Reglamento Delegado (UE) 2017/589), con testing de algoritmos, autoevaluación anual (Art. 9), stress testing, kill-switch y controles pre-trade. El statement de ESMA del 30-may-2024 fijó la doctrina: responsabilidad última del consejo y registros que documenten el uso de IA —procesos de decisión, fuentes de datos, algoritmos y cualquier modificación a lo largo del tiempo (BuilderWorld) . El briefing supervisor del 26-feb-2026 cerró el círculo: la firma es plena y únicamente responsable aunque use algoritmos de terceros; la IA debe reconocerse explícitamente en la autoevaluación anual RTS 6; compliance debe entender cómo la IA impacta las decisiones del algoritmo; y un "cambio material" que dispara retesting es cualquier modificación que pueda alterar comportamiento, perfil de riesgo o postura de cumplimiento, incluidos los cambios acumulativos —la cláusula más exigente para un agente cuyo modelo actualiza el proveedor sin avisar (Docs by LangChain) . La AFM neerlandesa lo resume: los algoritmos —y los agentes— deben ser explainable, auditable, no actuar de forma no intencionada, con líneas claras de rendición de cuentas (Docs by LangChain) .
Trampa común: leer «no es alto riesgo» como «no está regulado»
«El trading con IA no es alto riesgo bajo el AI Act» es probablemente la frase más mal leída del módulo. La conclusión correcta no es «podemos relajarnos hasta diciembre de 2027», sino «el AI Act no es nuestro ancla principal — pero hay tres capas que sí muerden ya»:
- AI Act, lo vigente: alfabetización en IA (Art. 4, desde feb-2025) y transparencia (Art. 50, desde 2-ago-2026): un chatbot que hable con inversores debe revelar que es IA, so pena de hasta 15 M€ o el 3 % de la facturación mundial.
- El ancla sectorial: MiFID II Art. 17 y RTS 6 exigen testing, kill-switch, controles pre-trade y la autoevaluación anual que ya debe reconocer la IA explícitamente — con retesting ante cambios materiales acumulativos, incluidos los que el proveedor del modelo hace sin avisar.
- DORA: si el proveedor de LLM/cloud soporta funciones críticas, toca registro de información, derechos de auditoría y estrategia de salida.
El AI Act es la capa horizontal; la regulación sectorial financiera es la vertical. Que la primera se aplaze no suspende ninguna de las otras dos.
10.2 Enforcement y precedentes judiciales
10.2.1 El AI washing de la SEC y el record-keeping 17a-4
Sin regla específica de IA, la SEC encontró la vía en el arsenal existente: Marketing Rule 206(4)-1, Secciones 206(2) y 206(4) del Advisers Act y deber fiduciario. La doctrina quedó fijada en una sola jornada —18-mar-2024, las dos primeras acciones de AI washing de la historia— y se endureció seis meses después con un caso de fraude. Las prioridades de examen de 2026 anuncian continuidad: la División examinará si las representaciones sobre capacidades de IA son justas y exactas, si los controles son coherentes con los disclosures y si los algoritmos producen recomendaciones consistentes con las estrategias declaradas (mSightFlow) .
Tabla 10.2 — Casos de enforcement por AI washing (SEC, 2024–2025)
| Firma | Fecha | Importe | Conducta | Base legal |
|---|---|---|---|---|
| Delphia (USA) Inc. | 18-mar-2024 | $225{,}000 | Afirmó usar ML y datos de clientes en sus algoritmos de inversión sin haberlo hecho (ADV, web, press releases, 2019–2023) (Apify) | Advisers Act 206(2), 206(4); Marketing Rule |
| Global Predictions Inc. | 18-mar-2024 | $175{,}000 | Se declaró falsamente "first regulated AI financial advisor"; forecasts de IA sin evidencia del modelo afirmado (Apify) | Advisers Act 206(2), 206(4); Marketing Rule |
| Rimar Capital USA / Liptz / Boro | 10-oct-2024 | $310{,}000 en multas; $213{,}611 de disgorgement; barra de 5 años para Liptz | Plataforma "AI-driven" inexistente; ~$4{,}000{,}000 captados de 45 inversores; AUM inflado ($16–20 M declarados vs <$2 M reales) (Massive) | Antifraude; orden SEC PR 2024-167 |
| Presto Automation Inc. | 14-ene-2025 | Sin multa (cooperación y remediación) | "Presto Voice" presentado como IA propia; >70% de los pedidos "automatizados" requerían agentes humanos (Github) | Securities Act 17(a)(2); Exchange Act 13(a) |
Los importes son modestos, pero la doctrina es la lección: no hizo falta ninguna regla nueva de IA —las de siempre sobre declaraciones engañosas bastaron— y el efecto reputacional y de barras profesionales excede con creces la multa. El patrón de conducta es constante: afirmar capacidades de IA inexistentes o de terceros como propias, sin evidencia documental que las respalde. Consecuencia interna directa: toda afirmación sobre IA en un ADV, factsheet o presentación debe ser trazable a un artefacto verificable (evaluaciones, trazas, registros de producción). Presto añade el matiz de la cotizada: el AI washing también contamina el reporting societario, y la cooperación temprana mitiga la sanción económica pero no la censura (Github) .
Caso desarrollado 1 — SEC v. Rimar Capital (10-oct-2024). Rimar Capital USA, su CEO Itai Liptz y su director Clifford Boro captaron unos $4{,}000{,}000 de 45 inversores presentando una plataforma de trading automatizado "impulsada por IA" que, según la orden de la SEC, no existía; declaraban un AUM de $16–20 millones frente a menos de $2 millones reales, con apropiación de fondos. El acuerdo: Liptz pagó $213{,}611 de disgorgement más intereses y $250{,}000 de multa civil, con prohibición de asociación y derecho a reaplicar en cinco años; Boro pagó $60{,}000 (Massive) . El caso delimita el deber de veracidad técnica: si el memo de inversión dice "agente autónomo con gating de riesgo", deben existir el grafo, el gating y la evidencia de ejecución —la diferencia entre marketing y realidad es, desde 2024, un riesgo de enforcement nominal, no teórico.
La segunda pata es el record-keeping. La Regla 17a-4 (enmendada oct-2022) exige conservar registros electrónicos en formato no reescribible y no borrable (WORM) o mediante una pista de auditoría completa que permita recrear el original, con retenciones típicas de 3–6 años (OrbTop) . El sweep de canales no oficiales acumula desde 2021 más de $2{,}000 millones en multas: JPMorgan, $200{,}000{,}000 (dic-2021); dieciséis firmas, $1{,}100{,}000{,}000 en una sola jornada (27-sep-2022) (RavenPack) . La extensión analógica es inmediata: un "chat con el modelo" sobre negocio es un canal de comunicaciones; si un LLM genera o transforma notas de research, mensajes a clientes o minutas, esos outputs —y, en la práctica examinadora, los prompts y contextos que los produjeron— deben preservarse (OrbTop) . Un agente sin archivo de trazas es, bajo esta lectura, el equivalente 2026 del trader con WhatsApp personal.
En Reino Unido, la referencia de coste de fallar es Citigroup Global Markets Ltd (mayo 2024): la PRA impuso £33{,}880{,}000 y la FCA £27{,}766{,}200 —total £61{,}600{,}000— por fallos en sistemas y controles de trading (2018–2022), cristalizados el 2-may-2022 (un operador introdujo $444{,}000{,}000 en vez de $58{,}000{,}000; se ejecutaron $1{,}400 millones en bolsas europeas) (firecrawl.dev) . La lección transferible: la ausencia de bloques duros preventivos y la calibración inadecuada de controles es un fallo de gobernanza, no de tecnología —la justificación regulatoria exacta del RiskGateway del módulo 9.
Ejemplo trabajado: auditar un factsheet con la doctrina Delphia
Supón que el equipo de distribución propone este párrafo para un factsheet: «Nuestro motor propietario de IA genera señales con deep learning sobre datos alternativos, bajo supervisión humana continua». Apliquemos el test que un examinador haría tras Delphia y Global Predictions: cada afirmación debe ser trazable a un artefacto verificable.
| Afirmación | Pregunta del examinador | Artefacto que la respalda | Caso que la ancla |
|---|---|---|---|
| «Motor propietario de IA» | ¿Es propio o de un vendor? | Contrato + arquitectura documentada; si es API de tercero, no se dice «propietario» | Global Predictions («first regulated AI advisor») |
| «Genera señales con deep learning» | ¿Qué modelo, con qué evidencia? | Traces de producción, evaluaciones, registros de versiones | Delphia (afirmó usar ML sin haberlo hecho) |
| «Sobre datos alternativos» | ¿Qué fuentes, con qué licencias? | Inventario de datasets y acuerdos de uso | Delphia (datos de clientes no usados) |
| «Supervisión humana continua» | ¿Quién, cuándo, con qué registro? | Checkpoints HITL con aprobador y decisión | Presto (>70 % requería humanos) |
Tres de las cuatro frases podrían ser ciertas y aun así ser sancionables si no existe el artefacto: la doctrina no castiga la ambición, castiga la diferencia entre marketing y producción sin evidencia documental. Y un matiz fácil de olvidar: el chat con el LLM corporativo con el que marketing redactó ese párrafo es en sí mismo un registro bajo la lectura extensiva de 17a-4 — el factsheet y su borrador conversacional deben poder producirse juntos.

La figura pone los importes del módulo en perspectiva: las multas por AI washing se miden en cientos de miles de dólares, mientras los fallos de record-keeping y de controles de trading se pagan en cientos de millones. No leas esto como «el AI washing sale barato»: el coste real de Delphia o Rimar es reputacional y de barras profesionales, y la lección es asimétrica — mentir sobre la IA te delata un documento; no archivar lo que la IA hizo te delata el examen entero.
10.2.2 Responsabilidad por alucinaciones y MNPI en prompts
Si el AI washing castiga decir de más sobre la IA, la jurisprudencia de alucinaciones castiga lo que la IA dice de más por la firma.
Caso desarrollado 2 — Moffatt v. Air Canada (2024 BCCRT 149, 14-feb-2024). El chatbot de la aerolínea inventó una política de reembolso retroactivo por duelo que no existía, y un pasajero reservó confiando en ella. Air Canada sostuvo que el chatbot era "una entidad legal separada responsable de sus propios actos"; el tribunal calificó el argumento de "remarkable submission" y condenó a la aerolínea por representación negligente: CA$812{,}02 (BuilderWorld) . El importe es trivial; la doctrina no: lo que el sistema dice, lo dice la firma. En gestión de activos, las cartas trimestrales, factsheets, respuestas a DDQ y comentarios de mercado generados con LLM son "comunicaciones" a efectos de la Marketing Rule, del Art. 24 de MiFID II y del Art. 50 del AI Act; la literatura jurídica europea exige que esos contenidos sean explainable, auditable and consistent con los demás canales (mediawatcher.ai) . La pregunta abierta la formuló en 2026 el juez Philip Jeyaretnam (Singapur): ¿puede un deployer eximirse demostrando entrenamiento, testing y monitoreo adecuados, o mediante disclaimers? (Benzinga) . Todo apunta a que la "debida diligencia algorítmica" documentada —trazas, evaluaciones, revisión humana— será la única línea de defensa disponible.
El segundo precedente, Mata v. Avianca (SDNY, 22-jun-2023), sancionó con $5{,}000 a dos abogados que presentaron seis casos inexistentes generados por ChatGPT —el modelo incluso "confirmó" sus propias citas fabricadas (fitgap.com) . La lección técnica fundamenta el patrón de grounding del curso: un LLM no puede verificar su propio output; la verificación exige una fuente externa autorizada, y toda cifra citada debe existir verbatim en ella.
Tabla 10.3 — Precedentes de alucinación y record-keeping: caso, jurisdicción, resultado, lección
| Caso | Jurisdicción | Resultado | Lección para agentes de trading |
|---|---|---|---|
| Moffatt v. Air Canada (2024 BCCRT 149) | Canadá (tribunal civil BC) | CA$812{,}02 por representación negligente; rechazado el argumento de "entidad separada" (BuilderWorld) | La firma responde por cada afirmación de su chatbot/agente; los outputs a clientes son comunicaciones reguladas |
| Mata v. Avianca (22-jun-2023) | EE. UU. (SDNY) | $5{,}000 de sanción; 6 citas fabricadas por ChatGPT (fitgap.com) | Un LLM no puede verificarse a sí mismo; cita obligatoria a fuente autorizada (RAG con grounding) |
| Sweep de canales no oficiales (2021–2024) | EE. UU. (SEC/CFTC) | >$2{,}000 M acumulados; $1{,}100 M en una sola jornada (27-sep-2022) (RavenPack) | Todo canal de comunicación de negocio debe archivarse; el chat con el LLM corporativo no es excepción |
| Citi CGML (may-2024) | Reino Unido (PRA + FCA) | £61{,}600{,}000 combinadas por controles de trading deficientes (firecrawl.dev) | Límites duros pre-trade y calibración documentada son gobernanza, no ingeniería opcional |
La lectura conjunta delimita el perímetro de responsabilidad del deployer: responde por lo que el agente dice (Air Canada), por lo que cita (Mata), por lo que deja sin registrar (record-keeping) y por lo que ejecuta sin límites (Citi). Ninguno requiere mala fe: bastan la representación negligente, la cita no verificada y el control descalibrado. Para un agente LangGraph en producción, la arquitectura se traduce en obligaciones: grounding con citas verificables, archivo inmutable de trazas, bloques duros en el gateway de ejecución y revisión humana firmada de toda comunicación externa. Cada columna de la tabla corresponde a un control del pipeline: verificación de fuentes, preservación de registros, límites pre-trade y supervisión humana demostrable. Quien no documenta no tendrá defensa que ofrecer (Benzinga) .
Nota de riesgo — MNPI en prompts: violación potencial per se. Introducir información material no pública (previews de resultados, M&A, posiciones) en una herramienta externa de IA puede constituir por sí solo una violación de las leyes de valores, aunque nadie opere con ella (businessmodelcanvastemplate.com) . El caso que fijó la conciencia del sector fue Samsung (abr–may 2023): en veinte días, ingenieros pegaron código fuente confidencial y una transcripción de reunión interna en ChatGPT en tres incidentes; la compañía restringió el uso y aceleró una alternativa interna (SmarterWay.AI) . Wall Street reaccionó antes que ningún otro sector: JPMorgan restringió ChatGPT a principios de 2023 y Goldman Sachs, Citi, Bank of America, Deutsche Bank y Wells Fargo siguieron (businessmodelcanvastemplate.com) . Los muros de información deben extenderse a las instancias de LLM: entornos segregados por lado del muro, DLP que bloquee el pegado de documentos wall-crossed, listas restringidas en el prompt-layer del gateway y registro del wall-crossing del propio sistema (quién, cuándo, qué información, cuándo se "limpia") (businessmodelcanvastemplate.com) .
En palabras llanas: lo que el sistema dice, lo dice la firma
El caso Air Canada cabe en una frase: un cliente preguntó al chatbot por reembolsos por duelo, el chatbot se inventó una política generosa, y cuando la aerolínea se negó a honrarla alegó que el chatbot era «una entidad legal separada responsable de sus propios actos». El tribunal dedicó al argumento dos palabras —remarkable submission— y condenó a la aerolínea: la empresa habla a través de su bot.
Traducción a gestión de activos: cada carta trimestral, respuesta a DDQ o comentario de mercado que sale de tu pipeline lleva tu firma, aunque la haya redactado el modelo. Y aquí encaja Mata v. Avianca: un LLM no puede verificar su propio output —en ese caso llegó a «confirmar» las citas que él mismo había fabricado—, de modo que la verificación tiene que venir de una fuente externa autorizada. De ahí que el patrón de grounding del curso no sea estética: es la única arquitectura que convierte «el modelo lo dijo» en «la firma puede demostrar de dónde salió». Los disclaimers («contenido generado por IA, puede contener errores») siguen sin haber salvado a nadie; la única línea de defensa seria es la debida diligencia algorítmica documentada.
10.3 Gobernanza práctica: la observabilidad como defensa
10.3.1 De la política al expediente: inventario, trazas y HITL
El vacío de SR 26-2 deja a las firmas sin una norma que les diga cómo gobernar la IA agéntica, pero plenamente responsables de los resultados. En ese hueco, la industria ha convergido hacia una arquitectura de gobernanza en cinco capas que este módulo presenta como práctica emergente, no como norma:
La primera capa es el inventario vivo de casos de uso —de agentes, no solo de modelos—: nombre, owner, proveedor, versión, datos de entrada, uso previsto y criticidad, incluido el shadow AI (MyEngineerPath) . La segunda es la política de uso de IA, cuyo núcleo es una matriz datos × modelo: dato público a cualquier LLM; interno sensible, solo a instancias empresariales con contrato de no retención y no entrenamiento; MNPI y estrategias propietarias, solo a modelos segregados u on-prem con barreras de información; datos personales, condicionados a base legal y minimización (SmarterWay.AI) . La tercera —la que da título a la sección— son las trazas como evidencia: para servir ante un examinador deben ser inmutables (WORM o hash encadenado, retención alineada a 17a-4 o MiFID II), ligar identidad y versión (agent_id, model_id, model_version, prompt de sistema, herramientas activas), registrar decisiones y no solo outputs (alternativas consideradas, puntos de aprobación humana) y ser recuperables en formato legible en plazos de examen (OrbTop) . La cuarta es el HITL graduado: human-on-the-loop con muestreo para research interno, human-in-the-loop con aprobación previa para comunicaciones a clientes, human-over-the-loop con límites duros y kill-switch para ejecución —con registros de override como KRI, porque un aprobador que acepta el 100% en dos segundos es un hallazgo de examen, no un control (Docs by LangChain) . La quinta es la auditoría: autoevaluación anual RTS 6 que integra la IA, producción de registros bajo 17a-4 y reporting trimestral al consejo (BuilderWorld) .
En la práctica institucional — cómo un fondo documenta sus agentes. Un fondo sistemático con tres agentes en producción (research RAG, monitor de riesgo diario, generador de comentarios trimestrales) implementa hoy el expediente así: cada ejecución deja una traza LangSmith con el árbol completo —prompt, documentos recuperados, llamadas a herramientas con argumentos, output, latencias, tokens— etiquetada con
agent_idymodel_version; cada interrupción HITL persiste un checkpoint de LangGraph que congela el estado del grafo en el momento de la aprobación, con el nombre del aprobador y su decisión. Nightly, un job exporta trazas y checkpoints a almacenamiento WORM con retención de siete años, indexado por fecha, agente y ticker. Cuando el examinador pide "la decisión del 14 de mayo sobre X", compliance reproduce la traza completa en minutos: qué vio el agente, qué calculó, qué propuso y quién aprobó. La práctica mapea la vía audit-trail de 17a-4 y el párrafo 24 del statement de ESMA (BuilderWorld) : es la respuesta de mercado al vacío de SR 26-2 —práctica emergente, no requisito explícito de ninguna norma— y, precisamente por eso, la única defensa disponible ante la pregunta del juez Jeyaretnam (From Concepts to Korean Language Benchmarks) .
Dos razones técnicas hacen esta disciplina estructural y no opcional. Primera, el no determinismo y las actualizaciones del proveedor: la validación pre-deployment no puede gobernar un sistema que cambia tras el despliegue —es una incompatibilidad estructural entre el marco clásico y la tecnología—, de modo que el control se desplaza al monitoreo continuo, la fijación de versiones y los triggers de revalidación (Institutional Asset Manager) ; la definición RTS 6 de "cambio material" acumulativo convierte cada actualización silenciosa del vendor en un potencial evento de retesting (Docs by LangChain) . Segunda, la alucinación como riesgo inherente: no eliminable por arquitectura, de modo que el control es en capas —grounding, citas obligatorias, rechazo limpio, revisión humana— y no en "parchear el modelo" (contextanalytics-ai.com) . Si cada capa de revisión detecta una fracción \(r\) de los errores y hay \(n\) capas independientes, la probabilidad residual de que una alucinación llegue al cliente es \(p_{\text{res}} = (1-r)^{n}\): la justificación cuantitativa de por qué el HITL debe ser real y distribuido, no ceremonial y concentrado.
El coste de cumplimiento debe presupuestarse con números. La estimación parlamentaria de referencia sitúa el AI Act entre €320{,}000 y €600{,}000 por entidad bajo clasificación de alto riesgo (pregunta escrita E-001210/2026, 24-mar-2026) (Apify) ; las implementaciones de transparencia rondan €15{,}000–31{,}000 el primer año, con 30–50% anual recurrente en los regímenes más exigentes (Stock Market: From Zero to Hero) . La asimetría importa: el coste fijo de validación y archivo pesa más en gestoras pequeñas y empuja a la concentración en grandes players y en los pocos vendors capaces de firmar contratos tipo DORA —la vulnerabilidad de dependencia de terceros que el FSB señaló al G20 en noviembre de 2024 (tessl.io) .
La conclusión cierra el Bloque IV: los patrones de los módulos 3 y 9 no eran preferencias de ingeniería. El interrupt HITL existe porque ESMA exige supervisión humana significativa y la aprobación ceremonial es un hallazgo de examen (BuilderWorld) ; el RiskGateway con límites duros existe porque Citi pagó £61{,}600{,}000 por no tenerlos calibrados (firecrawl.dev) ; el archivo de trazas existe porque, tras SR 26-2, la observabilidad es la única defensa que la firma puede construir por sí misma (From Concepts to Korean Language Benchmarks) . Quien construye sin observabilidad construye sin defensa legal.
Trampa común: el HITL ceremonial
El hallazgo de examen más incómodo no es la ausencia de revisión humana, sino su caricatura: un aprobador que acepta el 100 % de las propuestas con una mediana de dos segundos por decisión. Ese «humano en el bucle» no añade una capa de control; añade latencia y una falsa sensación de cobertura. Peor aún: deja un rastro documental que demuestra lo contrario de lo que pretendía.
Cómo se detecta a sí misma una firma antes de que lo haga el examinador, con KRIs sobre el registro de overrides:
- Tasa de override ≈ 0 % sostenida (ningún humano real coincide siempre con el modelo).
- Tiempo mediano de revisión incompatible con leer la propuesta y su evidencia.
- Aprobaciones en ráfagas (50 decisiones en 4 minutos) o fuera de horario de trabajo.
El vínculo con la fórmula \(p_{\text{res}} = (1-r)^{n}\) es directo: una capa ceremonial tiene \(r \approx 0\) y \((1-0) = 1\) —multiplica por uno, no reduce nada—. El HITL solo cuenta en la ecuación si es real.
Ejemplo trabajado: cuántas capas de revisión hacen falta
La justificación cuantitativa del HITL distribuido se ve mejor con números. Supón capas de revisión independientes que detectan cada una una fracción \(r = 0{,}8\) de las alucinaciones que les llegan. La probabilidad residual de que un error llegue al cliente es \(p_{\text{res}} = (1-r)^{n}\):
| Capas \(n\) | \(p_{\text{res}}\) | Reducción marginal |
|---|---|---|
| 1 | 20 % | — |
| 2 | 4 % | 16 p.p. |
| 3 | 0,8 % | 3,2 p.p. |
| 4 | 0,16 % | 0,64 p.p. |
Dos lecturas de diseño. Primera, los rendimientos decrecen: pasar de una a dos capas es la decisión más rentable; la cuarta capa apenas mueve la aguja y sí añade latencia y coste fijo —el coste de cumplimiento que el módulo cuantifica en €320.000–600.000 por entidad en régimen de alto riesgo—. Segunda, y más importante: la fórmula exige independencia. Dos capas que corren el mismo modelo con el mismo prompt comparten modos de fallo —si la alucinación engaña a la primera, probablemente engaña a la segunda— y el \(r\) efectivo se desploma. Por eso las capas deben fallar de forma distinta: verificación de grounding contra la fuente, cross-check numérico con herramienta determinista, revisión humana con evidencia a la vista. Y \(r\) no se asume: se mide por muestreo con ground truth. El ejercicio 3 te pedirá repetir este cálculo con otros valores de \(r\) y \(n\).
De la ejecución al expediente: anatomía de una traza defendible
El módulo describe las cinco capas de gobernanza; este diagrama baja un nivel y muestra el recorrido físico de la evidencia desde que el agente ejecuta hasta que el examinador recibe respuesta:
Fíjate en que cada eslabón responde a un requisito concreto del módulo: la traza LangSmith y el checkpoint fijan identidad y versión (agent_id, model_version) además de la decisión humana; el export WORM con hash encadenado satisface la vía audit-trail de 17a-4; y la reproducción «en minutos» es lo que el statement de ESMA espera cuando pide registros que documenten el uso de IA a lo largo del tiempo. Si algún eslabón falta, el expediente entero se devalúa: una traza sin checkpoint prueba lo que calculó el agente pero no quién aprobó; un checkpoint sin archivo inmutable no sobrevive a la pregunta «¿cómo sé que no lo editó después?».
Ejercicios
- Política de uso de IA. Redacte la política de uso de IA de un fondo con $2{,}000 M de AUM y estrategias long/short: matriz datos × modelo para cinco clasificaciones de datos y tres despliegues (API pública, instancia empresarial con zero-retention, modelo on-prem), con tratamiento del wall-crossing de instancias de LLM y procedimiento de excepciones. Justifique cada celda con la norma o el precedente que la ancla.
- Mapeo a RTS 6. Mapee cada componente del agente de ejecución del módulo 9 (grafo LangGraph, RiskGateway, kill-switch, herramientas deterministas, trazas) a los requisitos de RTS 6: testing, autoevaluación anual (Art. 9), controles pre-trade, monitoreo en tiempo real. Identifique qué eventos del ciclo de vida (cambio de versión del proveedor, nuevo tool, cambio de prompt de sistema) disparan retesting bajo la definición acumulativa de "cambio material".
- Matriz de escalado HITL. Diseñe la matriz de escalado para tres agentes (research interno, comentario trimestral a inversores, ejecución de rebalanceos): autonomía por caso de uso, criterios cuantitativos de escalado (tamaño de orden, desviación de benchmark, score de confianza del grounding), KRIs de override y detección de aprobación ceremonial. Estime \(p_{\text{res}} = (1-r)^{n}\) para \(r \in \{0{,}7, 0{,}9\}\) y \(n \in \{1, 2, 3\}\) y defienda el número de capas propuesto.
- Análisis de un caso de enforcement. Informe de dos páginas sobre SEC v. Rimar Capital (PR 2024-167, 10-oct-2024): línea temporal, declaraciones falsas, base legal, sanciones por persona y doctrina para disclosures de IA en ADV y marketing. Concluya con los tres controles internos que habrían impedido el caso y cómo se evidenciarían ante un examinador.
- Expediente de examen. Simule una petición de la Division of Examinations conforme a las prioridades 2026: enumere los artefactos que el fondo debe producir para demostrar que sus representaciones sobre IA son justas y exactas y coherentes con sus controles, especificando para cada uno formato, retención y el requisito de 17a-4 que satisface.
- Vacío SR 26-2. Un comité de riesgo pregunta: "Si SR 26-2 excluye la IA agéntica y no es vinculante, ¿por qué presupuestar gobernanza?". Prepare la respuesta del CRO en diez líneas, citando el carácter de la guía, las expectativas examinadoras, las consecuencias aguas abajo en ámbito y el contraste con PRA SS1/23 para la filial londinense.
Módulo 10 de 15 — LangChain para Trading Cuantitativo. Datos y versiones verificados a julio de 2026; precios y cifras de mercado sujetos a cambio. LangChain 1.3.14 / langchain-core 1.5.2.
Recursos de élite para seguir profundizando
- SR 11-7 — Supervisory Guidance on Model Risk Management (Fed, 2011): el texto original que SR 26-2 rescinde; hay que conocerlo para entender qué se ha perdido y qué persiste como buena práctica.
- SEC PR 2024-36 — cargos contra Delphia y Global Predictions: las dos primeras acciones de AI washing de la historia, con la doctrina de la Marketing Rule aplicada a claims de IA.
- SEC PR 2024-167 — SEC v. Rimar Capital: el caso desarrollado del módulo; la orden detalla declaraciones falsas, AUM inflado y sanciones por persona.
- FINRA Regulatory Notice 24-09: la referencia de neutralidad tecnológica — todo el rulebook, incluida la Regla 3110 de supervisión, aplicado a GenAI de vendors.
- PRA SS1/23 — Model risk management principles for banks: el contraste británico vigente que sí nombra a la IA y asigna la responsabilidad a un SMF.
- Comisión Europea — marco regulatorio de la IA: la página oficial para seguir el calendario del AI Act (transparencia, alto riesgo) tras el Digital Omnibus.
- NIST AI Risk Management Framework: el vocabulario común (govern, map, measure, manage) que ordena cualquier política de uso de IA defendible.
- MAS — principios FEAT: la referencia de Singapur sobre equidad, ética, accountability y transparencia, base de sus guidelines de riesgo de IA.
Comprueba lo aprendido
Autoevaluación con feedback inmediato. No se guarda ninguna puntuación: es solo para ti.