Cómo profundizar en el tema
Una implementación real añade sus propios datos y usuarios. Las decisiones pendientes son dónde desplegarla, cómo incorporar conocimiento propio y qué problemas abiertos importan cuando las bases ya están consolidadas.
Lleva los ejercicios a un runtime real
Continúa con el launchable de NemoClaw en Brev utilizado en el Módulo 3. Si no puedes usar Brev, la alternativa es una implementación local compatible. Para cualquiera de las dos opciones, elige un endpoint de modelo y decide cómo conservar las sesiones y los archivos del workspace.
- Alternativa local. Consulta los requisitos actuales de NemoClaw antes de instalar el stack en tu propio host, ya que los requisitos y las interfaces evolucionan. El mínimo documentado es de 4 vCPU, 8 GB de RAM y 20 GB de espacio libre en disco. La GPU es opcional si usas inferencia alojada. Para inferencia local, comprueba también los requisitos de hardware del modelo seleccionado.
- build.nvidia.com ofrece endpoints de modelos. Este curso usa la ruta de modelo que configures. Para una implementación independiente, configura
baseURLconhttps://integrate.api.nvidia.com/v1y proporciona una clave de la API de NVIDIA. Comprueba la interfaz del modelo elegido, el acceso de la cuenta y la cuota según las condiciones vigentes del servicio. - NemoClaw applications es la galería complementaria del launchable que ejecutaste. Los playbooks de NVIDIA para DGX Spark recorren agentes NemoClaw completos de extremo a extremo, incluidos un resumen diario de noticias, un agente de desarrollo de software, un revisor de presentaciones y un negociador de calendario. Inspecciona la política y los requisitos de runtime de cada playbook antes de adaptar el agente que operaste en el Módulo 3.
- Aloja el modelo con NIM cuando deba ejecutarse en tus instalaciones o en tu VPC. NVIDIA Inference Microservices reúne el modelo, el tokenizador y un servidor HTTP compatible con OpenAI en un contenedor. Los agentes Persona, Tooled y ReAct de los Módulos 1 y 2 pueden usar un endpoint NIM compatible después de verificar su modelo y su compatibilidad con llamadas a herramientas y salidas estructuradas.
- Compara los frameworks por el trabajo explícito que hacen. LangGraph ofrece máquinas de estados tipadas;
deepagentsimplementa la forma de planificador, sistema de archivos virtual y subagentes del Módulo 2c; CrewAI y AutoGen organizan flotas por roles. Compara cómo cada framework representa el estado, las herramientas, la recuperación, la delegación, la persistencia y la política del runtime.
El artefacto del navegador es una superficie de agente transferible
Cada página del curso es una lección y una aplicación pequeña. La interfaz expone estado, controles, resultados intermedios y puntos de aprobación; JavaScript ejecuta la orquestación local. Esta combinación funciona cuando la audiencia dispone de un navegador, pero no de un entorno de desarrollo preparado. El formato permite explicar un sistema de forma interactiva, controlar un flujo de trabajo dinámico o proporcionar una interfaz enfocada para scripts generales sobre datos cargados y servicios permitidos.
Algunos productos ya ofrecen este formato directamente. Anthropic describe los artefactos activos de Cowork como páginas HTML interactivas y persistentes que pueden actualizarse desde aplicaciones conectadas y archivos locales. La versión preliminar de OpenAI Apps SDK permite que una aplicación respaldada por MCP defina en conjunto el comportamiento del chat y la interfaz interactiva. Una página estática, un artefacto alojado y una aplicación dentro del chat utilizan contratos de host distintos, pero todos pueden presentar el mismo flujo de trabajo como estado inspeccionable y acciones acotadas.
Incorpora tus propios datos
El agente de indexación del Módulo 2b utilizó un corpus pequeño dentro de la página. Una implementación en producción exige más trabajo y más consideraciones; las referencias siguientes presentan rutas posibles.
- NeMo Retriever proporciona componentes de recuperación que amplían la búsqueda por similitud coseno en memoria del Módulo 2b. La búsqueda dispersa por palabras clave y la búsqueda vectorial densa se ejecutan en paralelo y sus puntuaciones se combinan. Un reclasificador reordena los candidatos por relevancia, y las primitivas de fragmentación configurables permiten controlar cómo se dividen los documentos antes de indexarlos. Combínalo con embeddings servidos por NIM y elige dónde alojar el stack de recuperación y sus datos.
- NVIDIA AI Blueprints proporcionan implementaciones de referencia para distintos flujos de trabajo. Compara sus requisitos y arquitectura con el planificador, las herramientas y la memoria del Módulo 2c antes de adaptar una.
- NeMo Data Curator ofrece herramientas de preparación de corpus, como deduplicación y filtrado. Evalúa la limpieza con tus tareas de recuperación; no garantiza que todas las respuestas mejoren.
- NeMo Guardrails añade filtros programables de entrada y salida, políticas de temas y comprobaciones de hechos en la capa de aplicación, por encima del modelo. Complementa la contención del kernel sin reemplazarla: ambas capas detectan clases de fallos diferentes y deben funcionar juntas.
¿Elegir el siguiente eje de producción que conviene profundizar?
Dónde se diferencia el trabajo de producción
Los proyectos de producción suelen profundizar en una de estas áreas:
- La capa de conocimiento. Evalúa la fragmentación estructural, la recuperación de imágenes de páginas y la fidelidad de las respuestas en los distintos tipos de documentos de tu corpus.
- El sustrato. Protocolos como MCP, Responses API, convenciones OTel GenAI y A2A mantienen herramientas y observabilidad portátiles entre proveedores y frameworks.
- Dinámica de flotas y contención. La ejecución de N agentes en paralelo cambia el problema: cada agente redescubre de forma redundante el mismo contexto (coste de redescubrimiento), las topologías con demasiados saltos pierden coherencia y un agente que califica la salida de un par puede alterar sus veredictos basándose en el contexto social en lugar del contenido. Cada agente aún necesita contención a nivel del kernel, como Landlock, seccomp y espacios de nombres de red, cuando las reglas del prompt y las medidas de protección no bastan para limitar el alcance del impacto.
Elige el eje que coincida con el problema recurrente de tu proyecto. NVIDIA Developer Blog reúne el trabajo de referencia más reciente en estas áreas.
NVIDIA Developer Blog →¿Abrir la lista completa de lecturas por módulo?
Lista de lectura organizada por módulo
Estas referencias amplían las lecturas de los módulos. Los artículos y la documentación pueden ser de acceso gratuito; algunos libros requieren compra o acceso institucional.
Los grupos temáticos siguen primero la estructura del curso y después se extienden al trabajo sobre flotas y evaluación.
Módulo 1 · Fundamentos de modelos y agentes
- Russell & Norvig (2020). Artificial Intelligence: A Modern Approach, 4.ª ed. Fuente del marco PEAS y de la taxonomía de agentes.
- Bratman (1987). Intention, Plans, and Practical Reason (la tupla BDI; resumen).
- Vaswani et al. (2017). Attention Is All You Need.
arXiv:1706.03762. El transformer. - Sennrich et al. (2015). Neural Machine Translation of Rare Words with Subword Units.
arXiv:1508.07909. Tokenización BPE. - Brown et al. (2020). Language Models are Few-Shot Learners.
arXiv:2005.14165. Presenta el aprendizaje en contexto. - Wei et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in LLMs.
arXiv:2201.11903. - Park et al. (2023). Generative Agents.
arXiv:2304.03442(citado en los Módulos 3a y 3c).
Módulo 1 · ReAct, uso de herramientas y salidas estructuradas
- Willard & Louf (2023). Efficient Guided Generation for LLMs.
arXiv:2307.09702. La teoría de máquinas de estados finitos que sustenta Outlines. - Schick et al. (2023). Toolformer.
arXiv:2302.04761(uso autosupervisado de herramientas). - Yao et al. (2022). ReAct: Synergizing Reasoning and Acting in LLMs.
arXiv:2210.03629. La figura del Módulo 1b se redibujó a partir de este trabajo. - OpenAI Structured Outputs · function calling.
- Referencia de Anthropic sobre tool use.
- Model Context Protocol · Outlines · XGrammar.
- JSON Schema draft 2020-12 spec.
Módulo 2 · Flujos de trabajo, recuperación e investigación profunda
- Xu et al. (2023). ReWOO: Decoupling Reasoning from Observations.
arXiv:2305.18323. - Wang et al. (2023). Plan-and-Solve Prompting.
arXiv:2305.04091. - Madaan et al. (2023). Self-Refine.
arXiv:2303.17651. - Lewis et al. (2020). Retrieval-Augmented Generation.
arXiv:2005.11401. La figura del Módulo 2b se redibujó a partir de este trabajo. - Karpukhin et al. (2020). Dense Passage Retrieval.
arXiv:2004.04906. - Johnson, Douze, Jégou (2017). Billion-scale similarity search with GPUs.
arXiv:1702.08734(FAISS). - Gao et al. (2022). HyDE.
arXiv:2212.10496. - Hsieh et al. (2024). RULER.
arXiv:2404.06654(benchmark de contexto largo). - Wang et al. (2023). Voyager.
arXiv:2305.16291. - LangChain Deep Agents · deepagents · LangGraph.
Módulo 3 · Runtimes persistentes y agentes de CLI
- Packer et al. (2023). MemGPT.
arXiv:2310.08560. - Karpas et al. (2022). MRKL Systems.
arXiv:2205.00445. - Liu et al. (2023). Lost in the Middle.
arXiv:2307.03172. Estudia la degradación en contextos largos y motiva la compactación. - Park et al. (2023). Generative Agents.
arXiv:2304.03442. - Wang et al. (2023). Voyager.
arXiv:2305.16291(agente siempre activo con biblioteca de habilidades). - Claude Code · Agent Skills.
- OpenAI Codex CLI.
- Hermes Agent (Nous Research) y su guía de seguridad. Es una aplicación de agente independiente, con habilidades adquiridas por experiencia, memoria persistente, tareas programadas y un gateway de mensajería. Sirve para comparar aplicaciones de agente con el runtime de seguridad OpenShell y el stack de referencia NemoClaw.
- NeMo Curator (pipeline de calidad de datos).
Módulo 4 · Evaluación y contención
- OpenTelemetry GenAI semantic conventions.
- Zheng et al. (2023). Judging LLM-as-a-Judge with MT-Bench.
arXiv:2306.05685. - Liu et al. (2023). G-Eval.
arXiv:2303.16634. - Liang et al. (2022). Holistic Evaluation of Language Models (HELM).
arXiv:2211.09110. - Saad-Falcon et al. (2023). ARES: An Automated Evaluation Framework for Retrieval-Augmented Generation Systems.
arXiv:2311.09476. - Greshake et al. (2023). Not what you've signed up for.
arXiv:2302.12173(inyección indirecta de prompts). - Inan et al. (2023). Llama Guard.
arXiv:2312.06674. - Willison (2025). The lethal trifecta.
- OWASP GenAI Top 10 · Landlock · seccomp-BPF.
- NeMo Guardrails · LangSmith · Arize Phoenix · Jaeger.
Además de este curso: el grupo final extiende las mismas cuestiones de diseño para flotas y adaptación de modelos.
Para ir más lejos · Sistemas multiagente y adaptación
- Cemri et al. (2025). Why Do Multi-Agent LLM Systems Fail? (MAST).
arXiv:2503.13657. - Wu et al. (2023). AutoGen.
arXiv:2308.08155. - Hong et al. (2023). MetaGPT.
arXiv:2308.00352. - Chen et al. (2024). Are More LLM Calls All You Need? Towards Scaling Laws of Compound Inference Systems
arXiv:2403.02419. - Xu et al. (2025). A-MEM: Atomic Notes for Agent Memory.
arXiv:2502.12110. - Christiano et al. (2017). Deep RL from Human Preferences (RLHF).
arXiv:1706.03741. - Rafailov et al. (2023). Direct Preference Optimization (DPO).
arXiv:2305.18290. - Bai et al. (2022). Constitutional AI.
arXiv:2212.08073. - NVIDIA AI-Q Blueprint · deepagents.
Continúa con la ruta de aprendizaje de IA agéntica de NVIDIA
Este curso es el complemento práctico de la Lección 6 de la Agentic AI Learning Path de NVIDIA, How to Build a Safer Autonomous Agent using OpenClaw. La ruta completa comienza con la creación de un primer agente y termina con el trabajo de seguridad que este curso estudia en profundidad. En medio, avanza a través de la recuperación, la evaluación, la personalización de modelos y agentes profundos que delegan y conservan la memoria. Cada lección empareja un concepto que conociste aquí con el lugar donde la ruta lo desarrolla más a fondo.
Lección 1 · How to Build an AI Agent
Retoma el bucle planificar-actuar-observar que construiste desde cero en el Módulo 1 y lo implementa con modelos NVIDIA Nemotron y LangGraph en un agente que genera informes.
Abrir →Lección 2 · How to Build an Agentic RAG Application
Amplía el agente de recuperación del Módulo 2b con búsqueda densa y dispersa, reranking y un almacén vectorial conectado a un agente ReAct que planifica sus propias consultas.
Abrir →Lección 3 · How to Evaluate AI Agents
Desarrolla la mitad de verificación del bucle: mide el éxito de la tarea, la calidad del uso de herramientas y la eficiencia de la trayectoria con métricas RAGAS y pipelines de LLM como juez.
Abrir →Lección 4 · How to Customize AI Agents
Cuando los prompts y las habilidades alcanzan su límite, incorpora conocimiento del dominio en los pesos del modelo: genera datos sintéticos con NeMo Data Designer y ajusta Nemotron con GRPO y LoRA.
Abrir →Lección 5 · How to Build Deep AI Agents
Implementa con la biblioteca deepagents de LangChain y NVIDIA AI-Q Blueprint los elementos que construiste a mano en el Módulo 2c: el planificador, la delegación de subagentes y la memoria del sistema de archivos virtual.
Abrir →Lección 6 · How to Build a Safer Autonomous Agent using OpenClaw
Resume el tema de este curso: acceso a la red denegado de forma predeterminada, sistema de archivos protegido con Landlock, refuerzo mediante seccomp, aislamiento de credenciales y evaluación continua de un agente persistente.
Abrir →Lecturas complementarias
- What Is Agentic AI? Presenta el razonamiento y la planificación iterativa que permiten resolver problemas de varias etapas de forma autónoma.
- Deep Agents glossary. Define planificación, delegación a subagentes, memoria en el sistema de archivos y habilidades: los cuatro elementos que combina el Módulo 2c.
- Traditional RAG vs. agentic RAG compara la recuperación fija con un agente que elige los pasos de recuperación. Evalúa la calidad, el coste y los fallos en tu tarea.
- Run autonomous agents more safely with NVIDIA OpenShell. Profundiza en la contención a nivel del kernel que estudiaste en los Módulos 3 y 4.
- Build a secure always-on local AI agent with NemoClaw. Muestra la instalación en DGX Spark y cómo el stack reúne OpenClaw, OpenShell, políticas e inferencia local.
- What OpenClaw agents mean for every organization. Explica cuándo conviene usar un agente persistente en infraestructura propia en lugar de una llamada aislada al modelo.
Conecta el ciclo, el flujo de trabajo, el runtime y la política
La ruta del modelo del navegador y el runtime del agente persistente se configuran por separado. Pueden usar modelos distintos. La parte reutilizable es la orquestación que los rodea, cuyo comportamiento debe probarse con el modelo elegido.
- El bucle. El Módulo 1 convirtió una única llamada de chat en un agente: colocó la llamada dentro de un bucle que ejecuta una herramienta, devuelve el resultado y repite hasta obtener la respuesta final. Esta es la capa de ejecución que proporciona un runtime como OpenClaw o un framework como LangGraph.
- El flujo de trabajo. El Módulo 2 comparó pipelines fijos, recuperación y ramas de investigación. Evalúa la selección de contexto y la redacción del prompt con la misma tarea y las mismas pruebas.
- El runtime. El Módulo 3 llevó estos flujos de trabajo a OpenClaw, donde las sesiones del gateway, los archivos del espacio de trabajo, las habilidades y las tareas programadas persisten más allá de una llamada del navegador.
- La contención. El Módulo 4 examinó restricciones de archivos, acceso de red y operaciones de procesos. Su efecto depende de la política activa y de su aplicación; el uso dañino de capacidades permitidas sigue siendo posible.
Estas capas pueden conservarse al actualizar el modelo. Antes de confiar en que se comporten igual, vuelve a probar los argumentos de las herramientas, los formatos de salida, los límites de contexto, la cancelación y los resultados de las tareas en el endpoint de sustitución.
Cuando un agente falla repetidamente, examina sus entradas, las respuestas del modelo, los resultados de las herramientas y las restricciones del runtime para localizar la causa. Elige la corrección a partir de esas pruebas. Las consideraciones de implementación siguientes plantean otras preguntas que conviene comprobar.
Qué comprobar antes de implementar
Mide la productividad en el trabajo que pretendes automatizar. El ensayo aleatorizado de METR de principios de 2025 con desarrolladores experimentados de código abierto encontró una ralentización considerable al usar un agente de programación, aunque esperaban trabajar más rápido y después afirmaron haberlo hecho. El resultado describe las herramientas, los desarrolladores y el trabajo estudiados en aquel momento. Contrasta las previsiones con mediciones de tu propia tarea y de las herramientas actuales.
Mide el valor de las llamadas adicionales al modelo. Chen et al. (2024) estudiaron la votación y el filtrado de respuestas obtenidas mediante llamadas repetidas. En las tareas estudiadas, añadir llamadas podía mejorar los resultados y después empeorarlos. Ese hallazgo no determina la mejor arquitectura de agentes para tu tarea. Mide si una llamada o un agente adicional corrige un fallo concreto y si su beneficio justifica su coste.
Prueba las comprobaciones de la aplicación y los permisos del entorno. Las solicitudes que pasan las comprobaciones de la aplicación aún pueden causar daños. Evalúa tanto el tratamiento de instrucciones no fiables como las capacidades disponibles para el agente.
Usa controles de ejecución independientes cuando un flujo pueda leer datos sensibles, cambiar archivos o comunicarse con el exterior. Verifica que esos controles se apliquen a cada ruta de ejecución.
Comprueba la autoridad administrativa por separado. La comprobación de lectura del Módulo 4a prueba métodos seleccionados con el token actual. La autoridad de escritura depende de su alcance y de la configuración del gateway. Examina esos permisos y protege la credencial; una lectura exitosa no demuestra control sobre el agente.
Mantén contigo el asistente del curso
El Asistente del curso, accesible mediante el botón ✦, está disponible en todas las lecciones en inglés. Precarga la página actual. Cuando una pregunta abarca varios módulos, el asistente puede consultar el mapa del curso, buscar en las lecciones y leer las páginas pertinentes. La persistencia local del navegador conserva las sesiones en este navegador: puedes retomarlas después de navegar o recargar la página, o crear otra para iniciar una consulta independiente. A medida que crece una sesión, el asistente compacta los turnos antiguos en memoria persistente, conserva literalmente el intercambio reciente e inicia un nuevo hilo de agente acotado a partir de ese estado.
Finaliza el curso
Comprobando tu progreso verificado en el curso.