Cómo profundizar en el tema
A estas alturas has creado un bucle de agente desde cero, lo has situado detrás de un sandbox a nivel del kernel y has medido el alcance del impacto que permite la política.
Una implementación real añade sus propios datos y usuarios. Las decisiones pendientes son dónde desplegarla, cómo incorporar conocimiento propio y qué problemas abiertos importan cuando las bases ya están consolidadas.
Lleva los ejercicios a un runtime real
Los ejercicios del navegador se diseñaron para aprender, con endpoints mediante proxy y sesiones que se reinician entre ejecuciones. Llevar el mismo trabajo a una implementación persistente exige elegir un runtime, un proveedor de inferencia y un modelo operativo para sesiones largas. Los endpoints alojados en la nube no requieren que el estudiante gestione una GPU; los requisitos de inferencia local dependerán del proveedor y del modelo seleccionados.
- Los requisitos previos actuales de NemoClaw incluyen rutas para Linux, macOS, Windows mediante WSL2 y DGX Spark. La base comienza en 4 vCPU y 8 GB de RAM; la GPU es opcional. Consulta la documentación vigente a medida que evolucionen los requisitos y las interfaces.
- build.nvidia.com aloja endpoints compatibles con OpenAI para todos los modelos que ofrece NVIDIA. Puedes reutilizar sin cambios los ejemplos de Python y JavaScript del curso: sustituye el
baseURLdel proxy porhttps://integrate.api.nvidia.com/v1y proporciona una clave de la API de NVIDIA. El acceso y la cuota de la cuenta siguen las condiciones actuales del servicio. - NemoClaw Applications es la galería complementaria del launchable que utilizaste. Los playbooks de NVIDIA para DGX Spark recorren agentes NemoClaw completos de extremo a extremo, como un resumen diario de noticias, un agente de desarrollo de software, un revisor de presentaciones y un negociador de calendario. Todos conservan la configuración de políticas estudiada en el Módulo 4. Lee uno como blueprint completo del agente siempre activo que preparaste en el Módulo 3.
- Aloja el modelo con NIM cuando deba ejecutarse en tus instalaciones o en tu VPC. NVIDIA Inference Microservices empaqueta el modelo, el tokenizador y un servidor HTTP compatible con OpenAI en un contenedor. Los agentes de los Módulos 1 y 2 se conectan a un endpoint NIM sin cambiar su estructura.
- Compara los frameworks por el trabajo explícito que hacen. LangGraph ofrece máquinas de estados tipadas;
deepagentsimplementa la forma de planificador, sistema de archivos virtual y subagentes del Módulo 2c; CrewAI y AutoGen organizan flotas por roles. Compara cómo cada framework representa el estado, las herramientas, la recuperación, la delegación, la persistencia y la política del runtime.
El artefacto del navegador es una superficie de agente transferible
Cada página del curso es una lección y una aplicación pequeña. La interfaz expone estado, controles, resultados intermedios y puntos de aprobación; JavaScript ejecuta la orquestación local. Esta combinación funciona cuando la audiencia dispone de un navegador, pero no de un entorno de desarrollo preparado. El formato permite explicar un sistema de forma interactiva, controlar un flujo de trabajo dinámico o proporcionar una interfaz enfocada para scripts generales sobre datos cargados y servicios permitidos.
Algunos productos ya ofrecen este formato directamente. Anthropic describe los artefactos activos de Cowork como páginas HTML interactivas y persistentes que pueden actualizarse desde aplicaciones conectadas y archivos locales. La versión preliminar de OpenAI Apps SDK permite que una aplicación respaldada por MCP defina en conjunto el comportamiento del chat y la interfaz interactiva. Una página estática, un artefacto alojado y una aplicación dentro del chat utilizan contratos de host distintos, pero todos pueden presentar el mismo flujo de trabajo como estado inspeccionable y acciones acotadas.
Incorpora tus propios datos
El agente de indexación del Módulo 2b utilizó un corpus pequeño dentro de la página. Una implementación en producción exige más trabajo y más consideraciones; las referencias siguientes presentan rutas posibles.
- NeMo Retriever lleva a una arquitectura de producción de la recuperación por similitud de coseno del Módulo 2b. La búsqueda dispersa por palabras clave y la búsqueda vectorial densa se ejecutan en paralelo y sus puntuaciones se combinan; un reranker reordena los candidatos por relevancia, y las primitivas de fragmentación configurables te permiten controlar cómo se dividen los documentos antes de indexarlos. Combínalo con embeddings servidos por NIM para obtener un stack de recuperación completamente local que mantenga los datos dentro de tu VPC.
- NVIDIA AI Blueprints ofrece implementaciones de referencia para arquitecturas comunes de agentes: un chatbot RAG, un extractor multimodal de PDF o un asistente de investigación. Cada blueprint es la configuración del Agente de Investigación (2c) adaptada y completamente desplegable para un dominio específico. Funcionan tanto como plantillas de inicio como para realizar un control de calidad (sanity check) de tu propia arquitectura.
- NeMo Curator trata la incorporación limpia de tu propio corpus como un proyecto independiente. Gestiona la deduplicación, el filtrado de idioma, la eliminación de información de identificación personal (PII) y la puntuación de coincidencias exactas a escalas donde hacerlo a mano deja de ser viable. La calidad de la recuperación depende directamente de la calidad de los datos, por lo que limpiar el corpus una vez beneficia a cada consulta que el agente realice en el futuro.
- NeMo Guardrails añade filtros programables de entrada y salida, políticas de temas y comprobaciones de hechos en la capa de aplicación, por encima del modelo. Complementa la contención del kernel sin reemplazarla: ambas capas detectan clases de fallos diferentes y deben funcionar juntas.
Aplicado · Siguiente¿Elegir el siguiente eje de producción que conviene profundizar?
Dónde se diferencia el trabajo de producción
Los proyectos de producción suelen profundizar en una de estas áreas:
- La capa de conocimiento. Recuperación apta para producción: fragmentación estructural, recuperación de imágenes de páginas y evaluación de fidelidad sobre corpus reales heterogéneos. Aquí es donde NeMo Retriever y los RAG AI Blueprints entran en juego para desarrollos reales.
- El sustrato. Protocolos como MCP, Responses API, convenciones OTel GenAI y A2A mantienen herramientas y observabilidad portátiles entre proveedores y frameworks.
- Dinámica de flotas y contención. La ejecución de N agentes en paralelo cambia el problema: cada agente redescubre de forma redundante el mismo contexto (coste de redescubrimiento), las topologías con demasiados saltos pierden coherencia y un agente que califica la salida de un par puede alterar sus veredictos basándose en el contexto social en lugar del contenido. Cada agente aún necesita contención a nivel del kernel, como Landlock, seccomp y espacios de nombres de red, cuando las reglas del prompt y las medidas de protección no bastan para limitar el alcance del impacto.
Elige el eje que coincida con el problema recurrente de tu proyecto. NVIDIA Developer Blog reúne el trabajo de referencia más reciente en estas áreas.
NVIDIA Developer Blog →Profundo · Fuentes¿Abrir la lista completa de lecturas por módulo?
Lista de lectura organizada por módulo
Esta sección reúne todas las fuentes citadas en las secciones de referencias de los módulos. Cada entrada está disponible sin restricciones mediante arXiv, la documentación de la organización o sus repositorios de GitHub.
Los grupos temáticos siguen primero la estructura del curso y después se extienden al trabajo sobre flotas y evaluación.
Módulo 1 · Fundamentos de modelos y agentes
- Russell & Norvig (2020). Artificial Intelligence: A Modern Approach, 4.ª ed. Fuente del marco PEAS y de la taxonomía de agentes.
- Bratman (1987). Intention, Plans, and Practical Reason (la tupla BDI; resumen).
- Vaswani et al. (2017). Attention Is All You Need.
arXiv:1706.03762. El transformer. - Sennrich et al. (2015). Neural Machine Translation of Rare Words with Subword Units.
arXiv:1508.07909. Tokenización BPE. - Brown et al. (2020). Language Models are Few-Shot Learners.
arXiv:2005.14165. Presenta el aprendizaje en contexto. - Wei et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in LLMs.
arXiv:2201.11903. - Park et al. (2023). Generative Agents.
arXiv:2304.03442(citado en los Módulos 3a y 3c).
Módulo 1 · ReAct, uso de herramientas y salidas estructuradas
- Willard & Louf (2023). Efficient Guided Generation for LLMs.
arXiv:2307.09702. La teoría de máquinas de estados finitos que sustenta Outlines. - Schick et al. (2023). Toolformer.
arXiv:2302.04761(uso autosupervisado de herramientas). - Yao et al. (2022). ReAct: Synergizing Reasoning and Acting in LLMs.
arXiv:2210.03629. La figura del Módulo 1b se redibujó a partir de este trabajo. - OpenAI Structured Outputs · function calling.
- Referencia de Anthropic sobre tool use.
- Model Context Protocol · Outlines · XGrammar.
- JSON Schema draft 2020-12 spec.
Módulo 2 · Flujos de trabajo, recuperación e investigación profunda
- Xu et al. (2023). ReWOO: Decoupling Reasoning from Observations.
arXiv:2305.18323. - Wang et al. (2023). Plan-and-Solve Prompting.
arXiv:2305.04091. - Madaan et al. (2023). Self-Refine.
arXiv:2303.17651. - Lewis et al. (2020). Retrieval-Augmented Generation.
arXiv:2005.11401. La figura del Módulo 2b se redibujó a partir de este trabajo. - Karpukhin et al. (2020). Dense Passage Retrieval.
arXiv:2004.04906. - Johnson, Douze, Jégou (2017). Billion-scale similarity search with GPUs.
arXiv:1702.08734(FAISS). - Gao et al. (2022). HyDE.
arXiv:2212.10496. - Hsieh et al. (2024). RULER.
arXiv:2404.06654(benchmark de contexto largo). - Wang et al. (2023). Voyager.
arXiv:2305.16291. - LangChain Deep Agents · deepagents · LangGraph.
Módulo 3 · Tiempos de ejecución persistentes y agentes CLI
- Packer et al. (2023). MemGPT.
arXiv:2310.08560. - Karpas et al. (2022). MRKL Systems.
arXiv:2205.00445. - Liu et al. (2023). Lost in the Middle.
arXiv:2307.03172. Estudia la degradación en contextos largos y motiva la compactación. - Park et al. (2023). Generative Agents.
arXiv:2304.03442. - Wang et al. (2023). Voyager.
arXiv:2305.16291(agente siempre activo con biblioteca de habilidades). - Claude Code · Agent Skills.
- OpenAI Codex CLI.
- Hermes Agent (Nous Research) y su guía de seguridad. Es una aplicación de agente independiente, con habilidades adquiridas por experiencia, memoria persistente, tareas programadas y un gateway de mensajería. Sirve para comparar aplicaciones de agente con el runtime de seguridad OpenShell y el stack de referencia NemoClaw.
- NeMo Curator (pipeline de calidad de datos).
Módulo 4 · Evaluación y contención
- OpenTelemetry GenAI semantic conventions.
- Zheng et al. (2023). Judging LLM-as-a-Judge with MT-Bench.
arXiv:2306.05685. - Liu et al. (2023). G-Eval.
arXiv:2303.16634. - Liang et al. (2022). Holistic Evaluation of Language Models (HELM).
arXiv:2211.09110. - Saad-Falcon et al. (2024). ARES: Automated Eval for RAG.
arXiv:2403.02419. - Greshake et al. (2023). Not what you've signed up for.
arXiv:2302.12173(inyección indirecta de prompts). - Inan et al. (2023). Llama Guard.
arXiv:2312.06674. - Willison (2025). The lethal trifecta.
- OWASP GenAI Top 10 · Landlock · seccomp-BPF.
- NeMo Guardrails · LangSmith · Arize Phoenix · Jaeger.
Además de este curso: el grupo final extiende las mismas cuestiones de diseño para flotas y adaptación de modelos.
Para ir más lejos · Sistemas multiagente y adaptación
- Cemri et al. (2025). Why Do Multi-Agent LLM Systems Fail? (MAST).
arXiv:2503.13657. - Wu et al. (2023). AutoGen.
arXiv:2308.08155. - Hong et al. (2023). MetaGPT.
arXiv:2308.00352. - Chen et al. (2024). Are More LLM Calls All You Need? Towards Scaling Laws of Compound Inference Systems
arXiv:2403.02419. - Xu et al. (2025). A-MEM: Atomic Notes for Agent Memory.
arXiv:2502.12110. - Christiano et al. (2017). Deep RL from Human Preferences (RLHF).
arXiv:1706.03741. - Rafailov et al. (2023). Direct Preference Optimization (DPO).
arXiv:2305.18290. - Bai et al. (2022). Constitutional AI.
arXiv:2212.08073. - NVIDIA AI-Q Blueprint · deepagents.
Continúa con la ruta de aprendizaje de IA agéntica de NVIDIA
Este curso es el complemento práctico de la Lección 6 de la Agentic AI Learning Path de NVIDIA, How to Build a Safer Autonomous Agent using OpenClaw. La ruta completa comienza con la creación de un primer agente y termina con el trabajo de seguridad que este curso estudia en profundidad. En medio, avanza a través de la recuperación, la evaluación, la personalización de modelos y agentes profundos que delegan y conservan la memoria. Cada lección empareja un concepto que conociste aquí con el lugar donde la ruta lo desarrolla más a fondo.
Lección 1 · How to Build an AI Agent
Retoma el bucle planificar-actuar-observar que construiste desde cero en el Módulo 1 y lo implementa con modelos NVIDIA Nemotron y LangGraph en un agente que genera informes.
Abrir →Lección 2 · How to Build an Agentic RAG Application
Amplía el agente de recuperación del Módulo 2b con búsqueda densa y dispersa, reranking y un almacén vectorial conectado a un agente ReAct que planifica sus propias consultas.
Abrir →Lección 3 · How to Evaluate AI Agents
Desarrolla la mitad de verificación del bucle: mide el éxito de la tarea, la calidad del uso de herramientas y la eficiencia de la trayectoria con métricas RAGAS y pipelines de LLM como juez.
Abrir →Lección 4 · How to Customize AI Agents
Cuando los prompts y las habilidades alcanzan su límite, incorpora conocimiento del dominio en los pesos del modelo: genera datos sintéticos con NeMo Data Designer y ajusta Nemotron con GRPO y LoRA.
Abrir →Lección 5 · How to Build Deep AI Agents
Implementa con la biblioteca deepagents de LangChain y NVIDIA AI-Q Blueprint los elementos que construiste a mano en el Módulo 2c: el planificador, la delegación de subagentes y la memoria del sistema de archivos virtual.
Abrir →Lección 6 · How to Build a Safer Autonomous Agent using OpenClaw
Resume el tema de este curso: acceso a la red denegado de forma predeterminada, sistema de archivos protegido con Landlock, refuerzo mediante seccomp, aislamiento de credenciales y evaluación continua de un agente persistente.
Abrir →Lecturas complementarias
- What Is Agentic AI? Presenta el razonamiento y la planificación iterativa que permiten resolver problemas de varias etapas de forma autónoma.
- Deep Agents glossary. Define planificación, delegación a subagentes, memoria en el sistema de archivos y habilidades: los cuatro elementos que combina el Módulo 2c.
- Traditional RAG vs. agentic RAG. Explica por qué un agente que planifica la recuperación puede superar una búsqueda fija, fundamento del agente de indexación del Módulo 2b.
- Run autonomous agents more safely with NVIDIA OpenShell. Profundiza en la contención a nivel del kernel que estudiaste en los Módulos 3 y 4.
- Build a secure always-on local AI agent with NemoClaw. Muestra la instalación en DGX Spark y cómo el stack reúne OpenClaw, OpenShell, políticas e inferencia local.
- What OpenClaw agents mean for every organization. Explica cuándo conviene usar un agente persistente en infraestructura propia en lugar de una llamada aislada al modelo.
Has construido un sistema alrededor de un modelo reemplazable
El papel del modelo no cambió entre módulos. El mismo modelo congelado y sin estado que ocupó la etapa de decisión del Módulo 1 también sustenta el agente profundo, la identidad de OpenClaw y el agente confinado en el sandbox.
Todo lo demás forma el entorno de ejecución: el sistema que rodea el modelo y permite trabajo autónomo y persistente. Cada módulo añadió una capa.
- El bucle. El Módulo 1 convirtió una única llamada de chat en un agente: colocó la llamada dentro de un bucle que ejecuta una herramienta, devuelve el resultado y repite hasta obtener la respuesta final. Esta es la capa de ejecución que proporciona un runtime como OpenClaw o un framework como LangGraph.
- El flujo de trabajo. El Módulo 2 delimitó lo que cada etapa podía ver y cómo circulaban los resultados por pipelines fijos, recuperación y ramas de investigación. Elegir qué incluir y excluir es ingeniería de contexto; esta elección influye en la respuesta tanto como en la formulación del prompt (Weng, 2023).
- El runtime. El Módulo 3 llevó estos flujos de trabajo a OpenClaw, donde las sesiones del gateway, los archivos del espacio de trabajo, las habilidades y las tareas programadas persisten más allá de una llamada del navegador.
- La contención. El Módulo 4 añadió una capa que no interpreta el prompt. OpenShell aplica sus reglas en el límite de las syscalls, por lo que una inyección exitosa aún no puede exceder lo estipulado por la política.
Tu ingeniería se acumula en esas capas, no en los pesos del modelo. Un modelo más potente puede incorporarse al mismo entorno con pocos cambios y conservar el resto del sistema.
Cuando un agente sigue fallando de la misma manera, la brecha suele ser una capa que aún no has construido, y una verificación aplicada por debajo de ella soluciona el fallo de forma más duradera que otra revisión del texto del prompt. Los siguientes patrones muestran cómo se ve ese trabajo en la práctica.
Qué comprobar antes de implementar
-
Mide la productividad; no confíes solo en la percepción. Un estudio aleatorizado de METR con desarrolladores experimentados de proyectos de código abierto observó una reducción de velocidad al usar un agente de programación, aunque los participantes esperaban y declaraban mejoras. Al evaluar un agente, compara la expectativa con el resultado medido. Esa distancia entre la previsión y el resultado medido es la conclusión clave que debes conservar al evaluar el valor de cualquier agente que despliegues.
-
Empieza con un solo agente fuerte. Los sistemas multiagente no siempre mejoran al aumentar la complejidad de la tarea (Chen et al., 2024). Más agentes añaden coordinación y nuevos modos de fallo. Antes de ampliar la topología, identifica qué fallo corregirá el nuevo agente. Sin una respuesta concreta, la complejidad adicional probablemente no compense.
-
La contención del kernel limita el impacto de una inyección exitosa. Las reglas del prompt y las protecciones de la aplicación ayudan, pero dependen de lo que el modelo y el entorno de ejecución pueden reconocer. Una instrucción maliciosa con apariencia válida puede atravesarlas.
Un agente con acceso al shell, a los archivos o a la red necesita una capa por debajo del prompt. Esta capa aplica reglas en el límite de las llamadas al sistema, fuera del alcance de las instrucciones del modelo.
-
El token administrativo queda por encima del sandbox. El sandbox limita lo que el agente puede hacer, pero no controla quién posee el token del operador. Quien lo posee puede:
- leer la personalidad del agente
- crear tareas cron
- cambiar el modelo y las herramientas
- inyectar un turno en la conversación
La robustez del sandbox y el alcance del token son medidas separadas.
El Módulo 4b mostró que ese token alcanza controles invisibles para el sandbox. Trata la credencial
operator.admincomo una contraseña de root: guárdala en almacenamiento restringido, concédele el menor alcance posible y rótala periódicamente. Para ese agente, tiene más alcance que root dentro del sandbox.
Mantén contigo el asistente del curso
El Asistente del curso, disponible mediante el botón ✦, aparece en todas las lecciones y recibe el contexto de la página actual. Cuando una pregunta cruza módulos, el asistente puede inspeccionar el mapa del curso, buscar en las lecciones y leer las páginas relevantes. La persistencia local en el navegador significa que las sesiones se quedan en este navegador: regresa a una de ellas después de navegar o recargar, o crea otra para una línea de investigación limpia. A medida que una sesión crece, el asistente compacta los turnos más antiguos en una memoria duradera, conserva literalmente los intercambios recientes e inicia un hilo de agente acotado y limpio desde ese estado.