Próximos passos
Uma implantação real acrescenta dados e usuários próprios. Agora você precisa escolher onde executá-la, como incorporar conhecimento e quais problemas merecem atenção depois que a base funciona.
Transfira os exercícios para um runtime persistente
Continue com o launchable do NemoClaw no Brev usado no Módulo 3. Se você não puder usar o Brev, a alternativa é uma implantação local compatível. Para qualquer uma das opções, escolha um endpoint de modelo e decida como preservar as sessões e os arquivos do workspace.
- Alternativa local. Confira os pré-requisitos atuais do NemoClaw antes de instalar a stack no seu próprio host, pois os requisitos e as interfaces evoluem. O mínimo documentado é de 4 vCPU, 8 GB de RAM e 20 GB de espaço livre em disco. A GPU é opcional ao usar inferência hospedada. Para inferência local, confira também os requisitos de hardware do modelo selecionado.
- build.nvidia.com fornece endpoints de modelos. Este curso usa a rota de modelo que você configurar. Para uma implantação separada, configure
baseURLcomohttps://integrate.api.nvidia.com/v1e forneça uma chave da API da NVIDIA. Verifique a interface do modelo selecionado, o acesso da conta e a cota conforme os termos atuais do serviço. - NemoClaw applications é a galeria complementar do launchable que você executou. Os playbooks da NVIDIA para DGX Spark percorrem agentes NemoClaw completos de ponta a ponta, incluindo um resumo diário de notícias, um agente de desenvolvimento de software, um revisor de apresentações e um negociador de calendário. Inspecione a política e os requisitos de runtime de cada playbook antes de adaptar o agente que você operou no Módulo 3.
- Hospede o modelo com NIM quando ele precisar ser executado nas suas instalações ou na sua VPC. NVIDIA Inference Microservices reúne o modelo, o tokenizador e um servidor HTTP compatível com OpenAI em um contêiner. Os agentes Persona, Tooled e ReAct dos Módulos 1 e 2 podem usar um endpoint NIM compatível depois que você verificar o modelo e o suporte a chamadas de ferramentas e saídas estruturadas.
- Compare frameworks pelo que tornam explícito. O LangGraph oferece máquinas de estado tipadas;
deepagentsimplementa a forma com planejador, sistema de arquivos virtual e subagentes vista em 2c; CrewAI e AutoGen organizam agentes por papéis. Observe como cada um representa estado, ferramentas, recuperação, delegação, persistência e política do runtime.
O artefato do navegador é uma superfície de agente transferível
Cada página do curso é uma lição e uma pequena aplicação. A interface expõe estado, controles, resultados intermediários e pontos de aprovação; JavaScript executa a orquestração local. Essa combinação funciona bem quando o público tem um navegador, mas nenhum ambiente de desenvolvimento preparado. Ele pode explicar um sistema de forma interativa, direcionar um workflow dinâmico ou fornecer uma interface focada para scripts gerais sobre dados carregados e serviços permitidos.
Alguns produtos já oferecem esse formato diretamente. A Anthropic descreve os artefatos ativos do Cowork como páginas HTML interativas e persistentes, atualizadas por aplicativos conectados e arquivos locais. A prévia do OpenAI Apps SDK permite que uma aplicação apoiada por MCP defina em conjunto o comportamento no chat e a interface. Páginas estáticas, artefatos hospedados e aplicações dentro do chat têm contratos de host diferentes, mas podem apresentar o mesmo workflow por meio de estado inspecionável e ações limitadas.
Use seus próprios dados
O agente de índice do Módulo 2b consultou um corpus pequeno na própria página. Uma implantação real exige ingestão, avaliação e operação mais robustas. As referências abaixo mostram caminhos de produção.
- NeMo Retriever fornece componentes de recuperação que vão além da busca por similaridade de cosseno em memória do Módulo 2b. A busca esparsa por palavras-chave e a busca vetorial densa são executadas em paralelo, e suas pontuações são combinadas. Um reclassificador reordena os candidatos por relevância, e primitivas configuráveis de fragmentação permitem controlar como os documentos são divididos antes da indexação. Combine-o com embeddings servidos pelo NIM e escolha onde hospedar a stack de recuperação e seus dados.
- NVIDIA AI Blueprints fornecem implementações de referência para diferentes workflows. Compare seus requisitos e arquitetura com o planejador, as ferramentas e a memória do Módulo 2c antes de adaptar uma delas.
- NeMo Data Curator fornece ferramentas de preparação de corpus, como deduplicação e filtragem. Avalie a limpeza com suas tarefas de recuperação; ela não garante que todas as respostas melhorem.
- NeMo Guardrails acrescenta filtros programáveis de entrada e saída, políticas de tópicos e verificações factuais na camada da aplicação. Ele complementa a contenção do kernel, não a substitui: as duas camadas tratam classes de falha diferentes.
Escolher o próximo eixo de produção a aprofundar?
Onde o trabalho de produção diverge
Os projetos de produção geralmente aprofundam uma dessas áreas:
- A camada de conhecimento. Avalie a fragmentação estrutural, a recuperação de imagens de páginas e a fidelidade das respostas nos diferentes tipos de documentos do seu corpus.
- O substrato. Protocolos como MCP, Responses API, convenções OTel GenAI e A2A mantêm ferramentas e observabilidade portáteis entre provedores e frameworks.
- Frotas dinâmicas e contenção. A execução paralela muda o problema: agentes podem redescobrir o mesmo contexto, topologias com muitos saltos perdem coerência e a avaliação entre pares pode sofrer influência social. Cada agente ainda precisa de contenção no kernel, como Landlock, seccomp e namespaces de rede, pois regras de prompt e proteções da aplicação não limitam sozinhas o raio de impacto.
Escolha o eixo correspondente ao obstáculo recorrente em seu projeto. O NVIDIA Developer Blog acompanha trabalhos de referência nessas áreas.
NVIDIA Developer Blog →Abrir a lista completa de leituras por módulo?
Lista de leitura, organizada pelo módulo
Estas referências ampliam as leituras dos módulos. Artigos e documentação podem ter acesso gratuito; alguns livros exigem compra ou acesso institucional.
Os grupos temáticos seguem este curso primeiro, depois estendem-se para a frota e os trabalhos de avaliação.
Módulo 1 · Fundações de modelos e agentes
- Russell & Norvig (2020). Artificial Intelligence: A Modern Approach, 4.ª ed. Fonte do framework PEAS e da taxonomia de agentes.
- Bratman (1987). Intenção, Planos e Razão Prática (a tupla BDI; summary).
- Vaswani et al. (2017). Attention Is All You Need.
arXiv:1706.03762. O transformer. - Sennrich et al. (2015). Neural Machine Translation of Rare Words with Subword Units.
arXiv:1508.07909. Tokenização BPE. - Brown et al. (2020). Language Models are Few-Shot Learners.
arXiv:2005.14165. Apresenta a aprendizagem em contexto. - Wei et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in LLMs.
arXiv:2201.11903. - Park et al. (2023). Generative Agents.
arXiv:2304.03442(referenciado através de M1c, M4, M6).
Módulo 1 · ReAct, uso de ferramentas e saídas estruturadas
- Willard & Louf (2023). Efficient Guided Generation for LLMs.
arXiv:2307.09702. A teoria de máquinas de estados finitos que sustenta o Outlines. - Schick et al. (2023). Toolformer.
arXiv:2302.04761(utilização de ferramentas auto-supervisionadas). - Yao et al. (2022). ReAct: Synergizing Reasoning and Acting in LLMs.
arXiv:2210.03629. A figura do Módulo 1b foi redesenhada com base neste trabalho. - OpenAI Resultados estruturados · function calling.
- Referência da Anthropic sobre uso de ferramentas.
- Model Context Protocol · Outlines · XGrammar.
- JSON Schema draft 2020-12 spec.
Módulo 2 · Workflow, recuperação e pesquisa profunda
- Xu et al. (2023). ReWOO: Decoupling Reasoning from Observations.
arXiv:2305.18323. - Wang et al. (2023). Plan-and-Solve Prompting.
arXiv:2305.04091. - Madaan et al. (2023). Self-Refine.
arXiv:2303.17651. - Lewis et al. (2020). Retrieval-Augmented Generation.
arXiv:2005.11401. A figura do Módulo 2b foi redesenhada com base neste trabalho. - Karpukhin et al. (2020). Dense Passage Retrieval.
arXiv:2004.04906. - Johnson, Douze, Jégou (2017). Billion-scale similarity search with GPUs
arXiv:1702.08734(FAISS). - Gao et al. (2022). HyDE.
arXiv:2212.10496. - Hsieh et al. (2024). RULER.
arXiv:2404.06654(benchmark de contexto longo). - Wang et al. (2023). Voyager.
arXiv:2305.16291. - LangChain Deep Agents · deepagents · LangGraph.
Módulo 3 · Runtimes persistentes e agentes de CLI
- Packer et al. (2023). MemGPT.
arXiv:2310.08560. - Karpas et al. (2022). MRKL Systems.
arXiv:2205.00445 - Liu et al. (2023). Lost in the Middle.
arXiv:2307.03172. Estuda a degradação em contextos longos e motiva a compactação. - Park et al. (2023). Generative Agents.
arXiv:2304.03442. - Wang et al. (2023). Voyager.
arXiv:2305.16291(agente sempre ativo com biblioteca de skills). - Claude Code · Agent Skills.
- OpenAI Codex CLI.
- Hermes Agent (Nous Research) e seu guia de segurança. Uma aplicação de agente separada com skills adquiridas com a experiência, memória persistente, cron embutido e um gateway de mensagens; útil ao comparar aplicações de agente com o runtime de segurança OpenShell e a stack de referência NemoClaw.
- NeMo Curator (pipeline de qualidade de dados).
Módulo 4 · Avaliação e contenção
- OpenTelemetry Convenções semânticas da GenAI.
- Zheng et al. (2023). Judging LLM-as-a-Judge with MT-Bench.
arXiv:2306.05685. - Liu et al. (2023). G-Eval.
arXiv:2303.16634. - Liang et al. (2022). Holistic Evaluation of Language Models (HELM).
arXiv:2211.09110. - Saad-Falcon et al. (2023). ARES: An Automated Evaluation Framework for Retrieval-Augmented Generation Systems.
arXiv:2311.09476. - Greshake et al. (2023). Not what you've signed up for.
arXiv:2302.12173(injeção indireta de prompt). - Inan et al. (2023). Llama Guard.
arXiv:2312.06674. - Willison (2025). The lethal trifecta.
- OWASP GenAI Top 10 · Landlock · seccomp-BPF.
- NeMo Guardrails · LangSmith · Arize Phoenix · Jaeger.
Além deste curso: o grupo final estende as mesmas questões de design para frotas e adaptação de modelo.
Indo mais longe · Sistemas multi-agentes e adaptação
- Cemri et al. (2025). Why Do Multi-Agent LLM Systems Fail? (MAST).
arXiv:2503.13657. - Wu et al. (2023). AutoGen.
arXiv:2308.08155. - Hong et al. (2023). MetaGPT.
arXiv:2308.00352. - Chen et al. (2024). Are More LLM Calls All You Need? Towards Scaling Laws of Compound Inference Systems
arXiv:2403.02419. - Xu et al. (2025). A-MEM: Atomic Notes for Agent Memory.
arXiv:2502.12110. - Christiano et al. (2017). Deep RL from Human Preferences (RLHF).
arXiv:1706.03741. - Rafailov et al. (2023). Direct Preference Optimization (DPO).
arXiv:2305.18290. - Bai et al. (2022). Constitutional AI.
arXiv:2212.08073. - NVIDIA AI-Q Blueprint · deepagents.
Continue com o caminho de aprendizagem da IA baseada em agentes NVIDIA
Este curso é o companheiro prático da Lição 6 do NVIDIA Agentic AI Learning Path, Como construir um agente autônomo mais seguro usando OpenClaw. O caminho completo começa com a construção de um primeiro agente e termina no trabalho de segurança que este curso cobre em profundidade. No meio, move-se através da recuperação, avaliação, personalização do modelo, e agentes profundos que delegam e persistem a memória. Cada lição abaixo emparelha um conceito que você encontrou aqui com o lugar onde o caminho o desenvolve ainda mais.
Lição 1 · Como construir um agente de IA
O ciclo de planejar, agir e observar que você construiu do zero no Módulo 1, aqui montado com modelos NVIDIA Nemotron e LangGraph em um agente de geração de relatórios.
Iniciar →Lição 2 · Como construir uma aplicação de RAG agente
Amplia o agente de recuperação do Módulo 2b com busca densa e esparsa, reranking e um banco vetorial conectado a um agente ReAct que planeja as próprias consultas.
Iniciar →Lição 3 · Como avaliar agentes de IA
A etapa de verificação do ciclo: medir o sucesso da tarefa, a qualidade do uso de ferramentas e a eficiência da trajetória com métricas RAGAS e pipelines que usam um LLM como juiz. Essa disciplina sustenta as decisões de confiabilidade deste curso.
Iniciar →Lição 4 · Como personalizar agentes de IA
Quando os prompts e as skills atingem seu limite, esta lição incorpora conhecimento do domínio aos próprios pesos: gera dados sintéticos com NeMo Data Designer e depois ajusta o Nemotron com GRPO e LoRA.
Iniciar →Lição 5 · Como construir agentes de IA profundos
O planejador, a delegação para subagentes e a memória em sistema de arquivos que você montou no Módulo 2c, agora implementados com a biblioteca Deep Agents do LangChain e o NVIDIA AI-Q Blueprint.
Iniciar →Lição 6 · Como construir um agente autônomo mais seguro usando OpenClaw
É o tema deste curso: rede bloqueada por padrão, sistema de arquivos protegido por Landlock, seccomp, isolamento de credenciais e avaliação contínua de um agente persistente.
Iniciar →Artigos auxiliares que valem a pena ler
- O que é IA baseada em agentes? Apresenta raciocínio e planejamento iterativo para resolver problemas em várias etapas de forma autônoma.
- Glossário de agentes profundos Define planejamento, delegação, memória em sistema de arquivos e skills, os quatro elementos combinados no Módulo 2c.
- Traditional RAG vs. agentic RAG compara a recuperação fixa com um agente que escolhe as etapas de recuperação. Avalie qualidade, custo e falhas na sua tarefa.
- Execute agentes autônomos com mais segurança usando NVIDIA OpenShell Aprofunda a contenção no kernel estudada nos Módulos 3 e 4.
- Crie um agente de IA local e sempre ativo com NemoClaw Mostra a instalação no DGX Spark e como a stack reúne OpenClaw, OpenShell, políticas e inferência local.
- O que os agentes OpenClaw representam para as organizações Discute quando usar um agente persistente em infraestrutura própria, em vez de uma chamada isolada ao modelo.
Conecte o ciclo, o workflow, o runtime e a política
A rota do modelo do navegador e o runtime do agente persistente são configurados separadamente. Eles podem usar modelos diferentes. A parte reutilizável é a orquestração ao redor deles, cujo comportamento ainda precisa ser testado com o modelo escolhido.
- O ciclo. O Módulo 1 transformou uma única chamada de chat em um agente: envolveu a chamada em um ciclo que aciona uma ferramenta, devolve o resultado e repete até a resposta final. Essa é a camada de execução fornecida por um runtime como OpenClaw ou um framework como LangGraph.
- O workflow. O Módulo 2 comparou pipelines fixos, recuperação e ramificações de pesquisa. Avalie a seleção de contexto e a redação do prompt com a mesma tarefa e as mesmas evidências.
- O runtime. O Módulo 3 levou esses workflows ao OpenClaw, onde sessões do gateway, arquivos do workspace, skills e agendamentos persistem além de uma chamada do navegador.
- A contenção. O Módulo 4 examinou restrições de arquivos, acesso à rede e operações de processos. Seu efeito depende da política ativa e de sua aplicação; o uso prejudicial de capacidades permitidas continua possível.
Essas camadas podem ser mantidas nas atualizações do modelo. Antes de confiar no mesmo comportamento, teste novamente os argumentos das ferramentas, os formatos de saída, os limites de contexto, o cancelamento e os resultados das tarefas no endpoint substituto.
Quando um agente falha repetidamente, examine suas entradas, as respostas do modelo, os resultados das ferramentas e as restrições do runtime para localizar a causa. Escolha a correção com base nessas evidências. As considerações de implantação abaixo trazem outras perguntas para testar.
O que verificar antes de implantar
Meça a produtividade no trabalho que você pretende automatizar. O ensaio randomizado da METR, realizado no início de 2025 com desenvolvedores experientes de código aberto, encontrou uma desaceleração relevante com o uso de um agente de programação, embora eles esperassem trabalhar mais rápido e depois relatassem que isso havia ocorrido. O resultado descreve as ferramentas, os desenvolvedores e o trabalho estudados naquele momento. Compare previsões com medições da sua própria tarefa usando as ferramentas atuais.
Meça o valor das chamadas adicionais ao modelo. Chen et al. (2024) estudaram votação e filtragem de respostas obtidas por chamadas repetidas. Nas tarefas estudadas, adicionar chamadas podia melhorar os resultados e depois piorá-los. Essa descoberta não determina a melhor arquitetura de agentes para sua tarefa. Meça se uma chamada ou um agente adicional corrige uma falha específica e se o benefício justifica o custo.
Teste as verificações da aplicação e as permissões do ambiente. Solicitações que passam pelas verificações da aplicação ainda podem causar danos. Avalie tanto o tratamento de instruções não confiáveis quanto as capacidades disponíveis ao agente.
Use controles de execução independentes quando um fluxo puder ler dados sensíveis, alterar arquivos ou comunicar-se externamente. Verifique se esses controles se aplicam a cada caminho de execução.
Verifique a autoridade administrativa separadamente. A verificação de leitura do Módulo 4a testa métodos selecionados com o token atual. A autoridade de gravação depende de seu escopo e da configuração do gateway. Examine essas permissões e proteja a credencial; uma leitura bem-sucedida não comprova controle sobre o agente.
Mantenha o Assistente de Curso com você
O Assistente do Curso, acessível pelo botão ✦, está disponível em todas as lições em inglês. Ele pré-carrega a página atual. Quando uma pergunta envolve vários módulos, o assistente pode consultar o mapa do curso, pesquisar nas lições e ler as páginas relevantes. A persistência local do navegador mantém as sessões neste navegador: você pode retomá-las depois de navegar ou recarregar a página, ou criar outra para iniciar uma consulta independente. Conforme a sessão cresce, o assistente compacta os turnos antigos em memória persistente, preserva literalmente a conversa recente e inicia uma nova thread de agente com limites definidos a partir desse estado.
Conclua o curso
Verificando seu progresso validado no curso.