El stack LLM en la gestión de activos en 2026
Adopción real en el buy-side, casos institucionales verificados y la regla de oro: el LLM razona, la matemática decide, el humano veta.
Objetivos de aprendizaje
Al completar este módulo, el lector será capaz de:
- Interpretar las principales series de adopción de IA generativa (GenAI) en el buy-side entre 2022 y 2026, identificando qué mide exactamente cada fuente y dónde están sus límites metodológicos.
- Situar los despliegues institucionales verificados —Kensho/S&P Global, Bloomberg, JPMorgan, BlackRock, Man Group, Bridgewater, AQR, Balyasny, Point72— en el mapa de capacidades del stack LLM: comprender, razonar, actuar.
- Distinguir las funciones con retorno de inversión (ROI) demostrado —procesamiento de información, riesgo, cumplimiento, middle office— de aquellas sin evidencia, en particular la predicción de precios.
- Aplicar la regla arquitectónica central del curso: el LLM razona, la matemática decide, el humano veta.
- Evaluar críticamente los resultados autorreportados de la literatura académica de agentes de trading frente a la literatura de réplica independiente.
- Conocer la estructura del curso, sus prerrequisitos y las convenciones del entorno de laboratorio.
1.1.1 Trayectoria de adopción GenAI en trading institucional 2022–2026
Dos series documentan la penetración de la GenAI en el buy-side. La primera es perceptual: la encuesta anual e-Trading Edit de JPMorgan pregunta a traders institucionales qué tecnología consideran más influyente para el trading en los tres años siguientes. La opción "IA/ML" pasó del 25 % en 2022 al 53 % en 2023 y al 65 % en 2024; en la edición de enero de 2026, "IA generativa" aparece por primera vez como categoría separada y lidera con un 43 %, relegando a "machine learning / NLP" (procesamiento del lenguaje natural) al 18 % y a la integración API/EMS al 15 % (Medium) . La segunda serie es de uso declarado: el estudio académico Generative AI and Asset Management (Rutgers Business School con CoreData Research, agosto de 2025; 45 fondos, el 77 % con activos bajo gestión superiores a 1.000 M USD) estima que la adopción de herramientas GenAI en hedge funds pasó del 21 % a finales de 2022 al 33 % en 2023, el 63 % en 2024 y el 70 % en la ola de 2025 (galileo.ai) .

Figura 1.1 — Fuente: elaboración propia a partir de JPMorgan e-Trading Edit (ediciones 2022–2026, percepción de influencia) y Rutgers/CoreData (agosto de 2025, uso declarado). Datos a enero de 2026; las dos series no son comparables punto a punto (ver cautelas 1–4 siguientes).
Las cautelas metodológicas no son opcionales; son parte del dato:
- Las series miden objetos distintos. e-Trading Edit mide percepción de influencia futura, no uso; Rutgers/CoreData mide uso declarado con fines de inversión. No son comparables punto a punto ni componen una "tasa de adopción" única.
- El punto de 2026 no es una caída. El paso del 65 % (2024) al 43 % (2026) en la serie de JPMorgan refleja un cambio de instrumento: GenAI se escindió de ML/NLP, que lideraba las ediciones de 2024 y 2025. Sumadas, ambas categorías concentran el 61 % de las menciones, en continuidad con la tendencia previa (Medium) .
- La muestra académica sesga hacia fondos grandes. El 51 % de los participantes gestiona más de 10.000 M USD; la adopción en gestores emergentes es presumiblemente menor (galileo.ai) .
- Adopción declarada ≠ impacto medible. La encuesta EY 2025 a wealth y asset managers encuentra que el 95 % de las firmas ha escalado GenAI a múltiples casos de uso y el 78 % explora IA agéntica, pero solo algo más de una cuarta parte reporta impacto de negocio sustancial (fintechstudios.com) .
Un último dato de la misma fuente académica ilustra por qué la prudencia es la norma editorial de este curso: un test de diferencias-en-diferencias sobre posiciones 13F asocia a los hedge funds adoptantes entre un 2 % y un 4 % de rentabilidad anormal anualizada superior a los no adoptantes (galileo.ai) . Es la mejor evidencia econométrica disponible de valor real —y aun así es asociación, no causalidad: la versión de enero de 2025 del mismo paper estimaba 3–5 %, la revisión la rebajó, y los propios autores advierten de que el efecto se concentra en fondos grandes con talento de IA y se diluye a medida que la adopción se masifica (galileo.ai) .
1.1.2 Casos institucionales verificados
Más allá de las encuestas, existe evidencia primaria —blogs de ingeniería, notas de prensa, casos de cliente— de despliegues en producción. La tabla siguiente los ordena por su posición en el stack, no por notoriedad.
Tabla 1.1 — Despliegues institucionales de LLMs documentados con fuente primaria (a julio de 2026)
| Firma | Sistema (año) | Función documentada | Capa del stack |
|---|---|---|---|
| Kensho / S&P Global | "Grounding" (2026) | Router multi-agente sobre LangGraph: descompone consultas en sub-consultas para Data Retrieval Agents por dominio y agrega respuestas; evaluación multi-etapa con exact-match | Comprender (acceso a datos) (IDEAS/RePEc) |
| Bloomberg | ASKB (2026, beta) | Red de agentes en el Terminal: sintetiza datos estructurados, documentos, noticias y research con atribución de fuentes y código BQL exportable | Comprender / razonar (stevens.edu) |
| JPMorgan | LLM Suite (2024) | Asistente interno tipo ChatGPT para ~50.000 empleados (~15 % de la plantilla), descrito como "un research analyst"; antecedente: marca IndexGPT (2023) | Comprender (metacto.com) |
| BlackRock | Aladdin Copilot (2024) | Copiloto acotado al perímetro de Aladdin: no da consejo de inversión, filtros anti-alucinación por diseño | Comprender (riesgo) (arXiv.org) |
| Man Group (Numeric) | AlphaGPT (2025) | Workflow agéntico de 3 roles (ideas → código Python → evaluación estadística); las señales deben superar los mismos umbrales que el research humano | Razonar (generación de hipótesis) (Pynions) |
| Bridgewater | AIA Labs (2024) | Fondo macro de ~2.000 M USD con decisión primaria por máquina, sign-off del PM y kill switch; 11,9 % en 2025 según prensa | Actuar (gobernado) (LaunchDarkly) |
| AQR | ML en Apex (2025) | ML alimenta ~1/5 de las señales del fondo multi-estrategia insignia; parseo de earnings calls y ponderación de señales | Razonar (señales) (LangChain) |
| Balyasny | Plataforma BAM (2023–2026) | ~95 % de los equipos de inversión la usan; "Central Bank Speech Analyst": análisis macro de 2 días a ~30 minutos | Comprender / razonar (🦜️🔗 LangChain) |
| Point72 | Turion (2024) | Estrategia dedicada a IA que superó al fondo insignia en 2025; marketplace interno de modelos fine-tuned | Razonar / actuar (🦜️🔗 LangChain) |
La lectura correcta de la tabla es estructural, no cronológica. Ninguno de estos sistemas es un "trader autónomo" en el sentido de la literatura académica: los despliegues masivos (JPMorgan, BlackRock) son deliberadamente asistentes acotados con perímetros explícitos; los despliegues de generación de ideas (Man, Balyasny) escalan la fase de hipótesis y de código, no la de validación, que permanece humana y con umbrales idénticos a los del research tradicional (Pynions) . Incluso el experimento más radical —Bridgewater AIA— limita la máquina al régimen macro, mantiene dashboards que fuerzan el sign-off del gestor y un interruptor de parada, y su propio co-CIO, Greg Jensen, declara que usar LLMs para seleccionar acciones es "hopeless" por su incapacidad con la causalidad y su problema de alucinación (LaunchDarkly) . El patrón que emerge no es "sustituir al gestor" sino "construir una capa de comprensión y orquestación sobre datos propios, con veto humano en cada punto de decisión capital-intensivo".
En la práctica institucional — Kensho/S&P Global: el router multi-agente como infraestructura de datos
Kensho, el motor de IA de S&P Global, publicó en marzo de 2026 la arquitectura de "Grounding", su framework multi-agente en producción construido sobre LangGraph. Un router recibe la consulta en lenguaje natural, la descompone en sub-consultas específicas de dominio y las dirige a Data Retrieval Agents (DRA) mantenidos por los equipos de datos de equity research, renta fija o macroeconomía; las respuestas parciales se agregan en un patrón map-reduce (IDEAS/RePEc) . Sobre esa capa operan un asistente de equity research y un agente de cumplimiento ESG. Tres decisiones de ingeniería convierten el caso en referente: (i) evaluación multi-etapa —se evalúa por separado el routing, la calidad del dato y la completitud, con métricas de exact-match sobre el routing y el tool-calling, no solo juicio de otro LLM—; (ii) observabilidad con tracing de cada ejecución; (iii) un protocolo de datos común entre equipos (IDEAS/RePEc) . La misma infraestructura alimenta el servidor MCP (Model Context Protocol) con el que S&P Global expone Capital IQ Financials, transcripciones de earnings calls y company intelligence a Claude (julio de 2025) y a una app verificada para ChatGPT (febrero de 2026), con la garantía contractual de que los datos licenciados no se usan para entrenar modelos (🦜️🔗 LangChain) . La lección estratégica: los grandes proveedores ya no compiten solo por la terminal, sino por ser la capa de grounding de los LLMs que usan sus clientes.
1.1.3 Dónde está el ROI probado — y dónde no
La evidencia de adopción y la evidencia académica apuntan a la misma frontera. Entre los hedge funds adoptantes, el 91 % usa GenAI para procesar y analizar datos y texto (noticias, earnings calls) y el 65 % para apoyar decisiones de inversión (screening, generación de ideas, optimización); solo ~15 % ha entrenado o fine-tuneado modelos propios (galileo.ai) . Los ahorros realizados más grandes se concentran en cumplimiento, gestión de riesgo e IT, no en el front office (fintechstudios.com) . En middle office, la regla empírica es la del dato limpio: liquidaciones y reconciliación inversor-custodio —funciones con datos estructurados y volumen— ya entregan resultados medibles, con motores de reconciliación que automatizan más del 99 % de los emparejamientos y dejan al analista ~10 excepciones de alto riesgo; NAV oversight y contabilidad de alternativos siguen dependiendo de juicio humano (🦜️🔗 LangChain) .
En predicción de precios, en cambio, no existe evidencia comparable. En el benchmark FinBen (NeurIPS 2024), el mejor modelo evaluado alcanza ~0,54 de exactitud en forecasting de movimientos bursátiles —apenas por encima del azar— y los propios autores lo califican de "deficiencia notable" (TokenMix) . La posición institucional documentada coincide: la GenAI comprime costes de investigación y operaciones; no es una máquina de predicción de mercados (LaunchDarkly) .
Dos cifras circulan por la prensa como contra-narrativa y este curso las usa con etiqueta explícita. El informe MIT NANDA (The GenAI Divide, agosto de 2025) estima que el 95 % de los pilotos empresariales de GenAI no muestra impacto medible en la cuenta de resultados pese a 30.000–40.000 M USD de inversión (LangChain中文版文档) ; y S&P Global reporta, según prensa, que el 42 % de las iniciativas de IA se abandonaron antes de producción en 2025, frente al 17 % del año anterior (🦜️🔗 LangChain) . Ambas son narrativa de prensa cualificada, no dato duro: NANDA no es revisado por pares y "sin impacto medible" a menudo significa "sin línea base de medición"; la cifra de S&P llega vía fuentes secundarias. Se citan porque delimitan el riesgo real de los programas de IA, no porque constituyan medición de precisión estadística.
Nota de riesgo — limitaciones de las cifras de adopción
Toda la sección 1.1 descansa sobre encuestas autodeclaradas, casos de cliente publicados por vendors (OpenAI/Balyasny, LangChain/Kensho) y prensa financiera. Tres sesgos documentados: (i) sesgo de supervivencia publicitaria —las firmas publicitan éxitos; los fracasos llegan anonimizados vía consultoras, como el stock screener europeo abandonado por no poder explicar ante cumplimiento por qué favorecía ciertas small caps (towardsai.net) ; (ii) metodologías no auditables —las cifras MIT NANDA 95 % y S&P 42 % tienen trazabilidad metodológica opaca y se usan aquí solo como narrativa cualificada (LangChain中文版文档) ; (iii) riesgo regulatorio de marketing —la SEC ejecutó en marzo de 2024 sus primeras acciones por AI washing (Delphia: 225.000 USD; Global Predictions: 175.000 USD) contra asesores que afirmaban capacidades de IA inexistentes (博客园) . Toda afirmación sobre adopción o retorno debe leerse con su fecha, su muestra y su canal de publicación.
En palabras llanas: qué significa «ROI probado»
Cuando el curso dice que una función tiene «ROI probado» quiere decir algo muy concreto: hay una organización real que midió antes y después y publicó el resultado. Un resumen de una earnings call que pasaba de 2 horas a 10 minutos es ahorro medible. En cambio, «el modelo predijo el mercado» casi nunca sobrevive al examen: o no descuenta costes, o mira hacia atrás con datos que no existían en ese momento (look-ahead), o simplemente no se ha replicado de forma independiente.
La regla práctica que se usará en todo el curso:
- Comprender (leer, resumir, clasificar, extraer): ROI demostrado una y otra vez.
- Razonar (hipótesis, señales, vistas): ROI condicional — funciona como apoyo al analista, no como oráculo.
- Actuar (ejecutar, mover dinero): solo gobernado, con matemática determinista y firma humana. Sin excepciones documentadas en producción seria.
1.2 El nuevo rol del quant: de modelos a sistemas agénticos
1.2.1 Mapa de capacidades: comprender, razonar, actuar
El stack LLM institucional de 2026 se organiza en tres capas de capacidad, con una capa transversal de gobernanza. Comprender cubre la ingestión y recuperación de información no estructurada: RAG (retrieval-augmented generation, generación aumentada por recuperación) documental sobre filings, transcripciones y noticias, extracción de entidades y síntesis con atribución de fuentes —el territorio de Kensho Grounding, ASKB y el 91 % de los casos de uso reales (galileo.ai) . Razonar cubre agentes que invocan herramientas (tools): calculadoras de métricas, optimizadores, APIs de datos, intérpretes de código; el LLM orquesta pasos y herramientas deterministas —el territorio de AlphaGPT y de las plataformas multi-strategy (Pynions) . Actuar cubre la ejecución gobernada: construcción y rebalanceo de carteras, enrutamiento de órdenes, siempre tras controles deterministas y aprobación humana —el territorio, con límites explícitos, de Bridgewater AIA (LaunchDarkly) .
La autonomía crece hacia abajo en la pila con exigencia de validación creciente: la comprensión documental tolera revisión por muestreo; el razonamiento exige evaluación sistemática; la acción exige determinismo, límites pre-trade y veto humano. Esta gradación no es una preferencia estética: es la única estructura compatible con la fiabilidad numérica de los modelos y con el marco de responsabilidad supervisor vigente.
Trampa común: confundir «capaz» con «fiable»
Un modelo puede ser capaz de producir un análisis brillante una vez y, aun así, no ser fiable para producirlo mil veces seguidas. En finanzas la unidad de medida no es la demo, es la tasa de error en producción con coste asociado. Por eso el mapa comprender → razonar → actuar no ordena las tareas por lo impresionantes que son, sino por dónde está medido el límite del error: en «comprender» el error se corrige con exact-match y evaluación; en «actuar» el error es una pérdida real — de ahí el veto humano.
1.2.2 La regla de oro: el LLM razona, la matemática decide, el humano veta
Tres líneas de evidencia independientes convergen en el mismo patrón arquitectónico, que constituye la columna vertebral de este curso.
La primera línea es académica. FinCon (NeurIPS 2024), el framework de agentes con mejor pedigrí de venue, no deja el control de riesgo al LLM: implementa un gating de riesgo con CVaR (Conditional Value at Risk, pérdida esperada en la cola) al 1 % como restricción externa al modelo, junto a una jerarquía manager-analyst (Github) . ThesisAgent, una variante operativa de los frameworks multi-agente, separa explícitamente razonamiento de decisión: el LLM produce trazas de razonamiento y una capa de "Decision Hub" fusiona señales y asigna capital con matemática determinista; sus autores documentan que el pipeline completo con LLM produce decisiones idénticas, a nivel de acción, a las del framework puramente matemático —el LLM añade interpretabilidad, no cambia la matemática (LangChain中文文档) .
La segunda línea es de fiabilidad numérica. Los LLMs cometen errores en aritmética financiera de libro abierto: en FinanceBench, GPT-4-Turbo con recuperación respondió incorrectamente o se negó a responder el 81 % de las preguntas financieras (Docs by LangChain) , y FinCon admite alucinaciones en producción, como índices de eventos de memoria inexistentes (Github) . Un sistema que deje al LLM calcular el VaR o el sizing hereda esa tasa de error en el punto de máximo daño.
La tercera línea es regulatoria. ESMA espera que la IA usada en trading algorítmico se integre en la autoevaluación anual del RTS 6 de MiFID II y ha dejado explícito que la responsabilidad no se transfiere ni al modelo ni al proveedor (Docs by LangChain) . La consecuencia operativa: alguien con nombre y responsabilidad legal debe poder vetar cada decisión con impacto en capital.
De aquí la regla de oro del curso: el LLM razona, la matemática decide, el humano veta. El LLM lee, resume, propone y orquesta; las métricas de riesgo, la optimización de cartera y el dimensionamiento se calculan con código determinista; y la aprobación final —mediante un interrupt de humano en el bucle (HITL, human-in-the-loop)— precede a cualquier orden. Cada módulo aplicado del curso implementa este patrón.
El flujo completo de una decisión gobernada
La regla de oro no es un eslogan: es una arquitectura. Así fluye una decisión real a través de las tres capas — fíjate en que el LLM nunca toca la última milla:
Dos detalles que importan en producción: todo lo que se descarta queda registrado (es evidencia para auditoría y para mejorar los prompts), y el humano que firma ve el razonamiento completo, no solo la recomendación final.
1.2.3 Qué se cree y qué no se cree la comunidad
La literatura académica de agentes LLM para trading (2023–2026) reporta resultados extraordinarios. La literatura de réplica independiente documenta por qué esos números no son estrategias desplegables. Ambas son ciertas sobre objetos distintos, y la tabla siguiente las pone cara a cara.
Tabla 1.2 — Resultados autorreportados vs. literatura de réplica y auditoría (a julio de 2026)
| Afirmación autorreportada | Fuente | Contraevidencia / auditoría | Fuente |
|---|---|---|---|
| TradingAgents: retorno acumulado 26,62 % y ratio de Sharpe 8,21 en AAPL (ene–mar 2024) | (🦜️🔗 LangChain) | Los propios autores admiten que el Sharpe excede el rango empírico plausible (ventana de 3 meses sin correcciones); 11 llamadas LLM y >20 llamadas a tools por predicción | (langchain.js) |
| FinCon: retorno acumulado 113,84 %, Sharpe 3,269 (oct 2022–jun 2023) | (Github) | Resultados no replicados independientemente; alucinaciones admitidas en gestión multi-activo | (Github) |
| HedgeAgents: 70 % anualizado, 400 % en 3 años | (arXiv.org) | El mismo equipo documenta después el "espejismo de beneficios": los retornos se evaporan al terminar la ventana de conocimiento del modelo | (arXiv.org) |
| Lopez-Lira & Tang: Sharpe 3,8 (GPT-4) en long-short de sentiment, >500 % acumulado | (arXiv.org) | Sin costes de transacción; el Sharpe cambia entre versiones del paper (3,8 → 3,28); el propio primer autor publicó después The Memorization Problem | (arXiv.org) |
| La ventaja LLM se sostiene fuera de muestra | — | FINSABER (20 años, >100 símbolos): las ventajas se deterioran; conservadoras en mercados alcistas, agresivas en bajistas | (arXiv.org) |
| Los agentes gestionan capital en vivo | — | DeepFund (trading en vivo post-cutoff): DeepSeek-V3 y Claude-3.7-Sonnet con pérdidas netas | (arXiv.org) |
| Los backtests son auditables | — | Auditoría de 77 estudios: ninguno alcanza el tier máximo de reproducibilidad; minoría documenta splits temporales, costes o survivorship | (Interactive ML) |
La interpretación correcta de la tabla no es nihilista. Los números estrella comparten cuatro debilidades documentadas —ventana corta, ausencia de costes, fuga de información (leakage) paramétrica o por corpus, y ausencia de réplica independiente— y el canal de fuga más insidioso es el paramétrico: un LLM evaluado sobre datos anteriores a su fecha de corte de entrenamiento puede "recordar" el futuro a través de sus pesos, una forma de look-ahead bias sin análogo clásico que la inspección del código del pipeline no puede descartar (arXiv.org) . El marco escéptico clásico se aplica además con más fuerza a ventanas de tres meses: McLean y Pontiff miden degradaciones medias del 26 % fuera de muestra y del 58 % post-publicación en predictores publicados, y el Deflated Sharpe Ratio de Bailey y López de Prado muestra que bastan ~3 intentos de backtest para fabricar significancia espuria (Github) . El ratio de Sharpe que gobierna esa corrección se define como
donde \(R_p\) es el retorno de la cartera, \(R_f\) la tasa libre de riesgo y \(\sigma_p\) la volatilidad del exceso de retorno; un Sharpe de 8,21 implicaría, con volatilidad de mercado ordinaria, una consistencia de retornos sin precedentes en la historia del hedge fund moderno —lo que constituye por sí mismo una señal de alarma metodológica (langchain.js) . El consenso institucional de 2026, articulado por The Alpha Illusion, es que estas arquitecturas son valiosas como andamiaje de investigación —roles, debate, memoria por capas, gating de riesgo— y como generadores de señales integrables en stacks cuantitativos clásicos, pero no como gestores autónomos de capital: "una narrativa de inversión plausible no es una probabilidad operable" (ProfitLogic) . Este curso adopta exactamente esa posición: enseña las arquitecturas como patrones de diseño y usa sus métricas como ejercicio de validación crítica.
1.3 Cómo usar este curso
1.3.1 Audiencia, prerrequisitos y recorrido
El curso está dirigido a tres perfiles que trabajan en el mismo pipeline: el desarrollador quant, que construirá los agentes y necesita dominio de LangChain v1, LangGraph y evaluación; el risk manager, que debe saber qué puede salir mal, cómo se gobierna un sistema agéntico y qué evidencia exigir; y el portfolio manager, que consume los outputs y retiene el veto. Los prerrequisitos son Python con soltura (funciones, clases, entornos virtuales), pandas para manipulación de series y tablas, y finanzas cuantitativas básicas: retornos, volatilidad, ratio de Sharpe, drawdown, nociones de backtesting. No se asume experiencia previa con LLMs.
Los quince módulos se agrupan en cuatro bloques que replican el mapa de capacidades de la sección 1.2.1 con exigencia de validación creciente:
- Bloque I — Fundamentos (M2–M3): LangChain v1 y
create_agent; agentes y grafos de estado con LangGraph. - Bloque II — Comprender (M4–M6): fuentes de datos financieros, RAG documental consciente de estructura financiera, ingeniería de prompts para tareas financieras.
- Bloque III — Razonar y decidir (M7–M9): riesgo cuantitativo con tools deterministas, construcción de carteras, señales y backtesting con disciplina anti-leakage.
- Bloque IV — Actuar con gobernanza (M10–M12): gobernanza y observabilidad, despliegue en producción, y proyecto capstone integrador.
El entorno de laboratorio es uniforme: Python 3.12, langchain v1.x, langgraph, pandas, numpy y un proveedor de datos de mercado con capa gratuita; cada módulo incluye notebooks ejecutables, datasets versionados y golden datasets de evaluación al estilo FinanceBench. Las convenciones editoriales son las ya vistas en este módulo: toda cifra lleva fecha y fuente; toda métrica de un paper se presenta con su ventana, sus costes y su estatus de réplica; y todo agente que el lector construya terminará en un interrupt de aprobación humana antes de tocar capital, incluso simulado.
Ejercicios
-
Código — reproducir y extender la serie de adopción. Reconstruya el gráfico
m1_adopcion.pnga partir de los datos citados en 1.1.1. Añada una tercera serie con los puntos de EY 2024 (52 % de hedge funds con GenAI desplegada (Quanthedge AI) ) y EY 2025 (95 % de firmas WAM con adopción escalada (fintechstudios.com) ). Documente en una celda markdown por qué las tres series no admiten un eje común sin advertencias. -
Análisis crítico — la caída que no fue. Un analista de prensa titula "El entusiasmo por la IA cae 22 puntos en el trading institucional (65 % → 43 %)". Escriba una refutación de 200 palabras usando la evidencia de 1.1.1, incluyendo qué pregunta exacta hace la encuesta y qué cambió en el instrumento de 2026 (Medium) .
-
Análisis crítico — lectura de estadísticas de prensa. Tome las cifras MIT NANDA (95 % (LangChain中文版文档) ) y S&P Global (42 % (🦜️🔗 LangChain) ). Para cada una, identifique: diseño de medición, definición operativa de "fracaso", canal de publicación y qué conclusión sí y cuál no se puede extraer. Proponga qué medición haría en su propia organización para no caer en la categoría "sin impacto medible".
-
Diseño — mapear un caso de uso al stack. Elija un proceso real de su función (p. ej., resumen de earnings calls, monitorización de riesgo, reconciliación). Dibuje su flujo sobre el diagrama comprender → razonar → actuar, marcando: qué hace el LLM, qué herramienta determinista invoca, dónde se evalúa con exact-match y dónde va el interrupt HITL. Justifique cada frontera con la regla de la sección 1.2.2.
-
Análisis crítico — auditoría exprés de un paper. Aplique la Tabla 1.2 como checklist a TradingAgents (🦜️🔗 LangChain) : ventana, costes, cutoff del backbone, universo, selección de resultados. Calcule qué Sharpe mínimo exigiría el criterio empírico de los propios autores (SR > 3 = excelente) y discuta qué evidencia adicional sería necesaria para tomarse el resultado en serio.
-
Diseño — evaluación al estilo Kensho. Diseñe sobre papel un golden dataset de 50 consultas para un router de datos financieros: 10 por dominio con su DRA correcto etiquetado. Especifique la métrica de exact-match de routing, un criterio de fallo para tool-calling y cómo integraría la evaluación en CI (integración continua) antes de cada despliegue (IDEAS/RePEc) .
Módulo 1 de 15 — LangChain para Trading Cuantitativo. Datos y versiones verificados a julio de 2026; precios y cifras de mercado sujetos a cambio. LangChain 1.3.14 / langchain-core 1.5.2.
Recursos de élite para seguir profundizando
- LangChain v1.0 — release notes oficiales: qué cambió exactamente en v1 y por qué importa al leer código de 2024–2025.
- JPMorgan e-Trading Edit: la encuesta anual que usa el módulo; conviene leer la pregunta exacta antes de citar cualquier cifra.
- Kensho (S&P Global) — engineering blog: casos de grounding y routers multi-agente contados por quien los construyó.
- arXiv — TradingAgents: el paper del debate bull/bear/judge que reaparecerá en el módulo 3; léelo junto a las críticas de réplica.
- NIST AI Risk Management Framework: el vocabulario de gobernanza que volverá en el módulo 10.
Comprueba lo aprendido
Autoevaluación con feedback inmediato. No se guarda ninguna puntuación: es solo para ti.