Próximos passos
Até aqui, você construiu o ciclo de um agente, colocou-o atrás de um sandbox no nível do kernel e mediu o raio de impacto permitido pela política.
Uma implantação real acrescenta dados e usuários próprios. Agora você precisa escolher onde executá-la, como incorporar conhecimento e quais problemas merecem atenção depois que a base funciona.
Transfira os exercícios para um runtime persistente
Os exercícios no navegador foram dimensionados para aprendizagem, com endpoints acessíveis e sessões que podiam ser reiniciadas. Uma implantação persistente exige a escolha de runtime, provedor de inferência e modelo operacional para sessões longas. Endpoints hospedados não exigem que o estudante administre uma GPU; a inferência local depende do provedor e do modelo escolhidos.
- Os pré-requisitos atuais do NemoClaw abrangem Linux, macOS, Windows via WSL2 e DGX Spark. A configuração básica começa com 4 vCPUs e 8 GB de RAM; a GPU é opcional. Consulte a documentação atual, pois requisitos e interfaces evoluem.
- build.nvidia.com oferece endpoints compatíveis com OpenAI para modelos hospedados pela NVIDIA. Os exemplos em Python e JavaScript permanecem iguais: troque o
baseURLdo proxy pelohttps://integrate.api.nvidia.com/v1e forneça uma chave da API NVIDIA. A conta e a cota seguem os termos de serviço vigentes. - NemoClaw Applications reúne playbooks para a mesma forma de launchable usada no curso. Os exemplos da NVIDIA para DGX Spark incluem resumo diário de notícias, agente de desenvolvimento, revisão de apresentações e negociação de calendário. Cada um reutiliza a configuração de políticas estudada aqui. Leia um playbook como implementação completa do agente sempre ativo criado no Módulo 3.
- Hospede com NIM quando o modelo precisar ser executado localmente ou em sua VPC. O NVIDIA Inference Microservices reúne modelo, tokenizer e servidor HTTP compatível com OpenAI em um contêiner. Os agentes dos Módulos 1 e 2 podem usar um endpoint NIM sem alterar sua estrutura.
- Compare frameworks pelo que tornam explícito. O LangGraph oferece máquinas de estado tipadas;
deepagentsimplementa a forma com planejador, sistema de arquivos virtual e subagentes vista em 2c; CrewAI e AutoGen organizam agentes por papéis. Observe como cada um representa estado, ferramentas, recuperação, delegação, persistência e política do runtime.
O artefato do navegador é uma superfície de agente transferível
Cada página do curso é uma lição e uma pequena aplicação. A interface expõe estado, controles, resultados intermediários e pontos de aprovação; JavaScript executa a orquestração local. Essa combinação funciona bem quando o público tem um navegador, mas nenhum ambiente de desenvolvimento preparado. Ele pode explicar um sistema de forma interativa, direcionar um workflow dinâmico ou fornecer uma interface focada para scripts gerais sobre dados carregados e serviços permitidos.
Alguns produtos já oferecem esse formato diretamente. A Anthropic descreve os artefatos ativos do Cowork como páginas HTML interativas e persistentes, atualizadas por aplicativos conectados e arquivos locais. A prévia do OpenAI Apps SDK permite que uma aplicação apoiada por MCP defina em conjunto o comportamento no chat e a interface. Páginas estáticas, artefatos hospedados e aplicações dentro do chat têm contratos de host diferentes, mas podem apresentar o mesmo workflow por meio de estado inspecionável e ações limitadas.
Use seus próprios dados
O agente de índice do Módulo 2b consultou um corpus pequeno na própria página. Uma implantação real exige ingestão, avaliação e operação mais robustas. As referências abaixo mostram caminhos de produção.
- NeMo Retriever leva a recuperação por similaridade do Módulo 2b a uma arquitetura de produção. Busca esparsa por palavras-chave e busca vetorial densa rodam em paralelo; as pontuações são combinadas; um reranker reorganiza os candidatos; e a segmentação configurável controla a divisão dos documentos antes da indexação. Com embeddings servidos por NIM, a stack pode permanecer em sua VPC.
- NVIDIA AI Blueprints oferece implementações de referência para formas comuns: chatbot RAG, extração multimodal de PDF e assistente de pesquisa. Cada blueprint adapta o agente de pesquisa de 2c a um domínio implantável. Use-os como ponto de partida e como referência para avaliar sua arquitetura.
- NeMo Curator trata a preparação do corpus como uma etapa própria. Ele oferece deduplicação, filtragem por idioma, remoção de dados pessoais e pontuação de qualidade em escala. A qualidade da recuperação depende dos dados; limpar o corpus beneficia todas as consultas posteriores.
- NeMo Guardrails acrescenta filtros programáveis de entrada e saída, políticas de tópicos e verificações factuais na camada da aplicação. Ele complementa a contenção do kernel, não a substitui: as duas camadas tratam classes de falha diferentes.
Aplicado · PróximoEscolher o próximo eixo de produção a aprofundar?
Onde o trabalho de produção diverge
Os projetos de produção geralmente aprofundam uma dessas áreas:
- A camada de conhecimento. Recuperação de qualidade de produção: blocagem estrutural, recuperação de imagem de página, avaliação de fidelidade em corporas reais heterogêneas. NeMo Retriever e o RAG AI Blueprints são onde isso é construído de verdade.
- O substrato. Protocolos como MCP, Responses API, convenções OTel GenAI e A2A mantêm ferramentas e observabilidade portáteis entre provedores e frameworks.
- Frotas dinâmicas e contenção. A execução paralela muda o problema: agentes podem redescobrir o mesmo contexto, topologias com muitos saltos perdem coerência e a avaliação entre pares pode sofrer influência social. Cada agente ainda precisa de contenção no kernel, como Landlock, seccomp e namespaces de rede, pois regras de prompt e proteções da aplicação não limitam sozinhas o raio de impacto.
Escolha o eixo correspondente ao obstáculo recorrente em seu projeto. O NVIDIA Developer Blog acompanha trabalhos de referência nessas áreas.
NVIDIA Developer Blog →Profundo · FontesAbrir a lista completa de leituras por módulo?
Lista de leitura, organizada pelo módulo
Este hub reúne as fontes citadas nas seções de referências dos módulos. Cada entrada está disponível no arXiv, na documentação da organização ou em um repositório público.
Os grupos temáticos seguem este curso primeiro, depois estendem-se para a frota e os trabalhos de avaliação.
Módulo 1 · Fundações de modelos e agentes
- Russell. & Norvig (2020). Artificial Intelligence: A Modern Approach, 4th ed. Onde vive o quadro e taxonomia de agentes PEAS.
- Bratman (1987). Intenção, Planos e Razão Prática (a tupla BDI; summary).
- Vaswani et al. (2017). Attention Is All You Need.
arXiv:1706.03762. O transformer. - Sennrich et al. (2015). Neural Machine Translation of Rare Words with Subword Units.
arXiv:1508.07909. Tokenização BPE. - Brown et al. (2020). Language Models are Few-Shot Learners.
arXiv:2005.14165. Apresenta a aprendizagem em contexto. - Wei et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in LLMs.
arXiv:2201.11903. - Park et al. (2023). Generative Agents.
arXiv:2304.03442(referenciado através de M1c, M4, M6).
Módulo 1 · ReAgir, usar ferramentas e saídas estruturadas
- Willard & Louf (2023). Efficient Guided Generation for LLMs.
arXiv:2307.09702. A teoria de máquinas de estados finitos que sustenta o Outlines. - Schick et al. (2023). Toolformer.
arXiv:2302.04761(utilização de ferramentas auto-supervisionadas). - Yao et al. (2022). ReAct: Synergizing Reasoning and Acting in LLMs.
arXiv:2210.03629. A figura do Módulo 1b foi redesenhada com base neste trabalho. - OpenAI Resultados estruturados · function calling.
- Referência antrópica do uso do tool.
- Modelo de Protocolo de Contexto · Contornos · XGrammar.
- JSON Schema draft 2020-12 spec.
Módulo 2 · Workflow, recuperação e pesquisa profunda
- Xu et al. (2023). ReWOO: Decoupling Reasoning from Observations.
arXiv:2305.18323. - Wang et al. (2023). Plan-and-Solve Prompting.
arXiv:2305.04091. - Madaan et al. (2023). Self-Refine.
arXiv:2303.17651. - Lewis et al. (2020). Retrieval-Augmented Generation.
arXiv:2005.11401. A figura do Módulo 2b foi redesenhada com base neste trabalho. - Karpukhin et al. (2020). Dense Passage Retrieval.
arXiv:2004.04906. - Johnson, Douze, Jégou (2017). Billion-scale similarity search with GPUs
arXiv:1702.08734(FAISS). - Gao et al. (2022). HyDE.
arXiv:2212.10496. - Hsieh et al. (2024). RULER.
arXiv:2404.06654(benchmark de longo prazo). - Wang et al. (2023). Voyager.
arXiv:2305.16291. - LangChain Deep Agents · deepagents · LangGraph.
Módulo 3 · Tempos de execução persistentes e agentes CLI
- Packer et al. (2023). MemGPT.
arXiv:2310.08560. - Karpas et al. (2022). MRKL Systems.
arXiv:2205.00445 - Liu et al. (2023). Lost in the Middle.
arXiv:2307.03172. Estuda a degradação em contextos longos e motiva a compactação. - Park et al. (2023). Generative Agents.
arXiv:2304.03442. - Wang et al. (2023). Voyager.
arXiv:2305.16291(sempre agente de biblioteca de competências). - Claude Code · Agent Skills.
- OpenAI Codex CLI.
- Hermes Agent (Nous Research) e seu guia de segurança ZSecurity. Uma aplicação de agente separada com skills da experiência, memória persistente, cron embutido e um gateway de mensagens; útil ao comparar aplicações de agente com a segurança OpenShell runtime e a referência NemoClaw stack.
- NeMo Curator (pipeline de qualidade de dados).
Módulo 4 · Avaliação e contenção
- OpenTelemetria Convenções semânticas da GenAI.
- Zheng et al. (2023). Judging LLM-as-a-Judge with MT-Bench.
arXiv:2306.05685. - Liu et al. (2023). G-Eval.
arXiv:2303.16634. - Liang et al. (2022). Holistic Evaluation of Language Models (HELM).
arXiv:2211.09110. - Saad-Falcon et al. (2024). ARES: Automated Eval for RAG.
arXiv:2403.02419. - Greshake et al. (2023). Not what you've signed up for.
arXiv:2302.12173(injeção indireta de prompt). - Inan et al. (2023). Llama Guard.
arXiv:2312.06674. - Willison (2025). The lethal trifecta.
- OWASP GenAI Top 10 · Encaixe de terra · seccomp- BPF.
- NeMo Guardrails · LangSmith · Arize Phoenix · Jaeger.
Além deste curso: o grupo final estende as mesmas questões de design para frotas e adaptação de modelo.
Indo mais longe · Sistemas multi-agentes e adaptação
- Cemri et al. (2025). Why Do Multi-Agent LLM Systems Fail? (MAST).
arXiv:2503.13657. - Wu et al. (2023). AutoGen.
arXiv:2308.08155. - Hong et al. (2023). MetaGPT.
arXiv:2308.00352. - Chen et al. (2024). Are More LLM Calls All You Need? Towards Scaling Laws of Compound Inference Systems
arXiv:2403.02419. - Xu et al. (2025). A-MEM: Atomic Notes for Agent Memory.
arXiv:2502.12110. - Christiano et al. (2017). Deep RL from Human Preferences (RLHF).
arXiv:1706.03741. - Rafailov et al. (2023). Direct Preference Optimization (DPO).
arXiv:2305.18290. - Bai et al. (2022). Constitutional AI.
arXiv:2212.08073. - NVIDIA AI-Q Blueprint · deepagents.
Continue com o caminho de aprendizagem da IA baseada em agentes NVIDIA
Este curso é o companheiro prático da Lição 6 do NVIDIA Agentic AI Learning Path, Como construir um agente autônomo mais seguro usando OpenClaw. O caminho completo começa com a construção de um primeiro agente e termina no trabalho de segurança que este curso cobre em profundidade. No meio, move-se através da recuperação, avaliação, personalização do modelo, e agentes profundos que delegam e persistem a memória. Cada lição abaixo emparelha um conceito que você encontrou aqui com o lugar onde o caminho o desenvolve ainda mais.
Lição 1 · Como construir um agente de IA
O loop plano-ato-observo que você construiu do zero no Módulo 1, aqui montado com modelos NVIDIA Nemotron e LangGraph em um agente de geração de relatórios.
Iniciar →Lição 2 · Como construir uma aplicação de RAG agente
Amplia o agente de recuperação do Módulo 2b com busca densa e esparsa, reranking e um banco vetorial conectado a um agente ReAct que planeja as próprias consultas.
Iniciar →Lição 3 · Como avaliar agentes de IA
A verificação metade do ciclo. Medindo o sucesso da tarefa, qualidade de uso de ferramentas e eficiência de trajetória com métricas RAGAS e pipelines LLM-as-juiz, a disciplina por trás de cada decisão de confiabilidade neste curso.
Iniciar →Lição 4 · Como personalizar agentes de IA
Quando a prompting e as skills atingem o limite, esta lição escreve o conhecimento do domínio nos próprios pesos: dados sintéticos com o NeMo Data Designer, então o Nemotron com GRPO e LoRA é afinado.
Iniciar →Lição 5 · Como construir agentes de IA profundos
O planejador, a delegação para subagentes e a memória em sistema de arquivos que você montou no Módulo 2c, agora implementados com a biblioteca Deep Agents do LangChain e o NVIDIA AI-Q Blueprint.
Iniciar →Lição 6 · Como construir um agente autônomo mais seguro usando OpenClaw
É o tema deste curso: rede bloqueada por padrão, sistema de arquivos protegido por Landlock, seccomp, isolamento de credenciais e avaliação contínua de um agente persistente.
Iniciar →Artigos auxiliares que valem a pena ler
- O que é IA baseada em agentes? Apresenta raciocínio e planejamento iterativo para resolver problemas em várias etapas de forma autônoma.
- Glossário de agentes profundos Define planejamento, delegação, memória em sistema de arquivos e skills, os quatro elementos combinados no Módulo 2c.
- RAG tradicional e RAG com agentes Explica por que um agente que planeja a recuperação pode superar uma busca fixa, fundamento do agente de índice do Módulo 2b.
- Execute agentes autônomos com mais segurança usando NVIDIA OpenShell Aprofunda a contenção no kernel estudada nos Módulos 3 e 4.
- Crie um agente de IA local e sempre ativo com NemoClaw Mostra a instalação no DGX Spark e como a stack reúne OpenClaw, OpenShell, políticas e inferência local.
- O que os agentes OpenClaw representam para as organizações Discute quando usar um agente persistente em infraestrutura própria, em vez de uma chamada isolada ao modelo.
O curso envolveu um modelo substituível em um harness
O papel do modelo permaneceu o mesmo. O modelo congelado e sem estado usado na função de decisão do Módulo 1 também sustenta o agente profundo e o OpenClaw executado no sandbox.
Todo o restante forma o harness: o sistema que envolve o modelo e permite trabalho autônomo e persistente. Cada módulo acrescentou uma camada.
- O ciclo. O Módulo 1 transformou uma única chat chamada para um agente em um agente: envolveu a chamada em um ciclo que aciona uma ferramenta, devolve o resultado e repete até a resposta final. Essa é a camada de execução fornecida por um runtime como OpenClaw ou um framework como LangGraph.
- O workflow. O Módulo 2 delimitou o que cada etapa podia ver e como os resultados circulavam por pipelines fixos, recuperação e ramos de pesquisa. Escolher o que incluir e excluir é engenharia de contexto; essa escolha influencia a resposta tanto quanto a formulação do prompt (Weng, 2023).
- O runtime. O Módulo 3 levou esses workflows ao OpenClaw, onde sessões do gateway, arquivos do workspace, skills e agendamentos persistem além de uma chamada do navegador.
- A contenção. O Módulo 4 acrescentou uma camada que não interpreta o prompt. O OpenShell aplica regras no limite do sistema; mesmo uma injeção bem-sucedida continua sujeita à política.
A engenharia se acumula nessas camadas, não nos pesos do modelo. Um modelo mais forte pode entrar no mesmo harness com pouco retrabalho, preservando o restante do sistema.
Quando um agente repete a mesma falha, procure uma camada ausente. Um controle aplicado abaixo do ponto de falha tende a ser mais durável que outra instrução no prompt. Os padrões seguintes mostram como fazer essa análise.
O que verificar antes de implantar
-
Meça a produtividade; não confie apenas na percepção. Um estudo randomizado da METR com desenvolvedores experientes de projetos open source encontrou redução de velocidade durante o uso de um agente de programação, embora os participantes esperassem e relatassem ganhos. Ao avaliar um agente, compare a previsão com o resultado medido.
-
Comece com um único agente forte. Sistemas multiagentes nem sempre vencem quando a tarefa se torna complexa (Chen et al., 2024). Mais agentes introduzem coordenação e novos modos de falha. Antes de ampliar a topologia, identifique qual falha o novo agente corrigirá. Sem uma resposta concreta, a complexidade adicional provavelmente não compensa.
-
A contenção do kernel limita o impacto de uma injeção bem-sucedida. Regras de prompt e proteções da aplicação ajudam, mas dependem do que o modelo e o harness conseguem reconhecer. Uma instrução maliciosa com aparência válida pode atravessá-las.
Um agente com acesso a shell, arquivos ou rede precisa de uma camada abaixo do prompt. Essa camada aplica regras no limite das syscalls, fora do alcance das instruções do modelo.
-
O token administrativo fica acima do sandbox. O sandbox limita o que o agente pode fazer, mas não controla quem possui o token do operador. Seu detentor pode:
- ler a persona
- criar tarefas cron
- alterar o modelo e as ferramentas
- injetar um turno na conversa
A robustez do sandbox e o alcance do token são medidas separadas.
O Módulo 4b mostrou que esse token alcança controles invisíveis ao sandbox. Trate a credencial
operator.admincomo uma senha de root: restrinja o armazenamento, use o menor escopo possível e faça rotação periódica. Para esse agente, ela alcança mais que o root dentro do sandbox.
Mantenha o Assistente de Curso com você
O Assistente do Curso, aberto pelo botão □, está disponível em todas as aulas e já recebe o contexto da página atual. Quando a pergunta atravessa módulos, ele pode consultar o mapa do curso, pesquisar as lições e ler páginas relevantes. As sessões persistem neste navegador: retome uma conversa depois de navegar ou recarregar, ou crie outra para começar sem histórico. Quando a sessão cresce, o assistente resume mensagens antigas em memória durável, mantém as trocas recentes e inicia um novo contexto limitado a partir desse estado.