Harness e grafos de agentes: o que a aula de Andrew Ng diz de fato
- O vídeo é a aula de carreira do Stanford CS230 (18/nov/2025); Ng fala ~15 min e não diz "o prompt morre em 7 meses".
- Os "7 meses" vêm de um slide do METR: a duração das tarefas que a IA conclui dobra a cada ~7 meses.
- Harness e grafos existem: são o código em volta do modelo e a forma do trabalho entre agentes.
Sumário · 15 seções
01Post original
- Link: x.com/0xnicc0/status/2106741374028578913 [2]
- Autor do post: @0xnicc0 (nome exibido: nicco), conta com selo azul; neste post, republica o vídeo de uma aula de terceiros.
- Publicado em: 04/out/2026, 10:40 (horário de Brasília) · na leitura de 04/out/2026: 11,2 mil visualizações, 70 curtidas, 11 republicações e 176 itens salvos.
- Texto (tradução): "Andrew Ng, fundador do Google Brain: 'o prompt vai morrer em 7 meses', 'harnesses é que vão substituí-lo'. Prompts → Agentes → Harness → Loops → Grafos → Sistemas que se autoaprimoram. Em 97 minutos, Andrew mostra como construir um harness que deixa agentes planejar, executar, verificar e melhorar sozinhos. Um harness carrega o contexto certo, encaminha cada tarefa, confere o resultado e dispara o passo seguinte. A maioria ainda está aperfeiçoando prompts enquanto a engenharia de IA já está indo para o harness. Assista hoje e depois salve o guia completo de harness engineering abaixo."
- Mídia: vídeo de 1h38min11s com legendas coloridas queimadas na imagem e a marca de Stanford no canto.
- Post citado: o artigo no X Graph Engineering: Stop Chaining Your Agents, de @seeconvm (14/ago/2026, 2,2 milhões de visualizações na leitura) [3].
- Notas da comunidade: nenhuma na leitura de 04/out/2026.
02Contexto
De onde vem o vídeo. É um recorte da Lecture 9: Career Advice in AI do curso CS230 (Deep Learning) de Stanford, no outono de 2025. A aula foi dada em 18/nov/2025 e publicada no canal oficial Stanford Online em 16/dez/2025, com 1h45min08s e cerca de 456 mil visualizações na leitura de 04/out/2026 [1]. A descrição lista três nomes: Laurence Moroney (autor de livros de IA, convidado), Andrew Ng e Kian Katanforoosh [1]. O recorte do post tem quase 7 minutos a menos que o original; os cortes não foram mapeados um a um.
Quem fala. Andrew Ng, fundador da DeepLearning.AI e líder fundador da equipe Google Brain [13], abre com uns 15 minutos de conselhos de carreira. O restante (mais de 80% do vídeo) é de Laurence Moroney, que trabalhou no Google e na Microsoft e hoje está na Arm, falando de mercado de trabalho, dívida técnica de código gerado por IA, hype e modelos pequenos [1].
Por que circula agora. Desde jul/2026, várias contas atribuem a Ng frases como "o prompt morre em 6 meses" e cada uma diz que ele vai ser substituído por uma coisa diferente: loops, grafos ou harness [7]. Em set/2026, um usuário do Hacker News identificou o vídeo original e notou que a palavra "graph" não aparece na transcrição [6]. Este post repete o padrão, agora com "7 meses" e "harness", e emenda um artigo de terceiros sobre grafos de agentes [3].
O tema por trás é real. "Harness engineering" virou nome de disciplina no início de 2026 [12]: a OpenAI descreveu um produto construído com 0 linha de código escrita à mão, em que o trabalho dos engenheiros passou a ser projetar o ambiente dos agentes [10], e a Anthropic publicou como estrutura agentes de longa duração [11].
03Afirmações × Realidade
Ng disse "o prompt vai morrer em 7 meses"
Não aparece na fala de Ng nem no restante do recorte (transcrição automática conferida para este material). Rastreios independentes não acharam a frase em canais de Ng, da DeepLearning.AI ou de Stanford [6][7].
De onde saíram os "7 meses"
No minuto 1 do recorte há um slide de Ng: "a duração das tarefas que a IA consegue fazer está dobrando a cada 7 meses", com gráfico do METR e a nota "para código, ~70 dias" [1][4]. É uma medida de capacidade, não um prazo para o fim do prompt.
"Harnesses estão substituindo o prompt" (atribuído a Ng)
A palavra não aparece na aula [6]. O conceito existe, mas vem de 2026 e de outras fontes [10][11][12]; e um harness continua cheio de prompts (instruções de sistema, descrições de ferramentas, arquivos de regras) [12].
"Em 97 minutos, Andrew mostra como construir um harness"
O vídeo tem 98 min, é uma aula de carreira e Ng fala ~15 min. O mais perto disso é um trecho de ~2 min em que Moroney resume um agente em 4 passos: intenção, plano, uso de ferramentas e reflexão [1].
"Fundador do Google Brain"
O site oficial de Ng o descreve como líder fundador da equipe Google Brain [13].
Legenda: ✅ confirmado por fonte independente · ⚠️ parcial ou exagerado · ❌ contradito · ❓ sem fonte.
04Verificação
- Fonte primária: a aula original no canal Stanford Online, com data, duração e palestrantes [1]. O recorte do post foi comparado com ela pelos quadros (marca de Stanford, slides, palestrantes) e por uma transcrição automática do áudio feita para este material.
- Ponto de partida: o post [2] e o artigo citado [3], lidos na íntegra.
- Independente 1: a publicação original do METR sobre a duração das tarefas (19/mar/2025), que mostra o gráfico usado no slide [4].
- Independente 2: a discussão no Hacker News que localizou o vídeo original e apontou o título enganoso de um reenvio anterior [6].
- Independente 3: o rastreio da TIMEWELL (09/ago/2026), que não achou fonte primária para a frase e registra as versões divergentes [7].
- Independente 4: documentação e cookbook da Anthropic sobre dynamic workflows [8][9]; textos de OpenAI [10], Anthropic [11] e O'Reilly [12] sobre harness.
O que mudou desde a aula (18/nov/2025) (checado em 04/out/2026):
- A métrica do slide foi revisada. Em 29/jan/2026, o METR publicou o Time Horizon 1.1: a duplicação de longo prazo ficou em 196,5 dias (os mesmos ~7 meses), mas, só com modelos desde 2024, ela cai para 88,6 dias [5]. O ritmo recente é mais rápido que o do slide.
- "Harness" ganhou nome e literatura. OpenAI (11/fev/2026) [10], Anthropic (24/mar/2026) [11] e O'Reilly (15/mai/2026) [12] passaram a tratar o ambiente em volta do modelo como a parte que mais pesa no resultado.
- Os grafos viraram recurso de produto. O Claude Code documenta dynamic workflows: até 16 subagentes ao mesmo tempo por padrão, limite de 1.000 por execução, e um fluxo pronto,
/deep-research, que divide a pergunta, busca em paralelo, confere as fontes e escreve um relatório citado [8][9]. - O que não mudou: a aula não é sobre harness, e nenhuma fonte primária sustenta que o prompt vai acabar.
Limites. A transcrição automática do recorte pode errar palavras; os minutos citados são do vídeo do post, não do original no YouTube. Não foi possível conferir se o artigo citado [3] usa recursos que já estão em todas as versões do Claude Code.
05Mapa do conteúdo
- 00:00–15:00 · Ng: com blocos de IA (LLMs, RAG, fluxos agentic, voz) e código assistido, qualquer aluno faz software que ninguém fazia um ano antes; slide do METR; ficar na geração mais recente das ferramentas de código.
- 03:00–05:00 · Ng: o gargalo passa a ser decidir o que construir. A proporção engenheiro por gerente de produto, antes de 4 a 8 para 1, cai em alguns times para perto de 1 para 1.
- 09:00–15:00 · Ng: escolha o time e as pessoas, não a marca; construa sem esperar permissão, com responsabilidade; trabalhe duro se puder.
- 15:00–33:00 · Moroney: um candidato que acompanhava mais de 300 vagas e era reprovado por parecer hostil nas entrevistas; mercado com menos vagas de entrada depois da supercontratação de 2022–2023; foco no negócio e em mostrar o que você fez.
- 33:00–52:00 · Moroney: risco e responsabilidade em IA (o caso dos filtros de imagem do Gemini); código gerado como dívida técnica: boa ("hipoteca") ou ruim ("cartão de crédito").
- 52:00–1:05:00 · Moroney: a moeda das redes sociais é engajamento, não precisão; um agente em 4 passos (intenção, plano, ferramentas, reflexão) aplicado a vendedores.
- 1:05:00–1:38:00 · Moroney: bolha, modelos grandes versus modelos pequenos e locais, IA no próprio aparelho; perguntas da plateia.
Tempos do vídeo anexado ao post [2], conferidos com a transcrição automática; palestrantes e data pela página oficial [1].
06Conceitos-chave
1. Duração das tarefas (o slide dos "7 meses")
- Em uma frase: o METR mede a duração, em tempo humano, das tarefas que um modelo conclui com 50% de sucesso; esse número dobrou a cada ~7 meses entre 2019 e 2025 [4].
- Explicação: em mar/2025, o melhor modelo medido, o Claude 3.7 Sonnet, tinha horizonte de cerca de uma hora; os modelos da época acertavam quase 100% das tarefas de menos de 4 minutos e menos de 10% das de mais de ~4 horas [4]. A revisão de jan/2026 manteve a tendência longa e mostrou ritmo maior desde 2024 [5].
- Erro comum: ler o gráfico como prazo ("em 7 meses acaba o prompt"). Ele diz que agentes aguentam tarefas cada vez mais longas, e isso aumenta a importância do que fica em volta do modelo.
2. Harness
- Em uma frase: tudo o que não é o modelo: o laço de execução, as ferramentas, o contexto, as permissões, a verificação e o estado [12].
- Explicação: um modelo sozinho só completa texto; vira agente quando um harness lhe dá ferramentas, memória e um ciclo de tentar, conferir e corrigir. Na OpenAI, um time de três engenheiros abriu ~1.500 pull requests em cinco meses, todos escritos por agentes, porque passou a investir em documentação legível, testes e regras checadas por máquina [10].
- Exemplo prático: em vez de um arquivo de instruções gigante, um índice curto que aponta para documentos mais profundos ("dê ao agente um mapa, não um manual de 1.000 páginas") [10].
- Princípio útil: "todo componente de um harness codifica uma suposição sobre o que o modelo não consegue fazer sozinho"; quando o modelo melhora, a peça pode sair [11].
3. Laço com avaliador separado
- Em uma frase: um agente gera, outro avalia com critérios explícitos, e o laço só fecha quando a avaliação passa.
- Explicação: a Anthropic montou um harness de três papéis (planejador, gerador e avaliador) para sessões de horas. Gerador e avaliador combinam antes o que é "pronto" em cada etapa, e o avaliador reprova a etapa se algum critério ficar abaixo do mínimo [11].
- Erro comum: pedir ao mesmo agente que avalie o próprio trabalho. Separar o juiz e afinar o juiz para ser cético funciona melhor [11].
4. Grafo de agentes: nós e arestas
- Em uma frase: nó é um trabalho com entrada e saída definidas; aresta é um dado que sai de um nó e entra em outro [3].
- Explicação: o artigo citado no post propõe uma pergunta simples para cada "e depois" de um fluxo: o próximo passo lê a saída do anterior? Se não lê, não existe aresta entre eles, e os dois podem rodar em paralelo [3].
- Contrato: cada nó devolve dados validados por um esquema (JSON Schema), e não texto livre; o Claude Code aceita um
schemaem cada chamadaagent()[3][9].
5. Leque e funil: parallel() × pipeline()
- Em uma frase:
parallel()roda várias tarefas ao mesmo tempo e espera todas (barreira);pipeline()passa cada item pelas etapas sem esperar os outros [8][9]. - Exemplo: auditar 18 arquivos: com barreira, o arquivo mais lento segura todos antes da etapa seguinte; em pipeline, quem termina antes já segue para a verificação.
- Regra do artigo: use barreira só quando a etapa precisa de todos os resultados juntos, como deduplicar ou ranquear [3]. Juntar e filtrar listas é código comum, sem agente e sem tokens [3][9].
6. Ciclo que converge
- Em uma frase: quando não se sabe o tamanho do trabalho (quantos bugs existem), o fluxo repete rodadas até K rodadas seguidas não acharem nada novo [3].
- Detalhe que decide: deduplicar contra tudo o que já foi visto, inclusive o que foi rejeitado; senão os mesmos falsos achados voltam toda rodada e o laço nunca para [3]. A documentação do Claude Code traz um exemplo parecido: rodar testes repetidamente e parar quando duas rodadas seguidas não acham nada novo [8].
7. Filtrar o hype (a lição que está mesmo no vídeo)
07Conexões
- Base: Agentes de IA, segundo Andrew Ng: da ideia ao sistema traz os quatro padrões de Ng (reflexão, ferramentas, planejamento e multiagentes) que este material mostra virando harness e grafo.
- Na prática: Code w/ Claude: 8 palestras sobre programar com agentes mostra sub-agentes, memória e rotinas numa ferramenta real de programação.
- Do lado de quem usa: How I use LLMs, de Andrej Karpathy (fev/2025) ajuda a separar o que muda no uso diário do que é só embalagem nova.
- Contraponto: a ideia de que "o prompt morreu" é contestada por quem trabalha com harness: as instruções só mudaram de lugar, do chat para arquivos versionados e descrições de ferramentas [7][12].
08Aplicações práticas
- Ao receber um "fulano disse", procure a fonte primária e o minuto exato antes de repassar; marcas na tela, nomes de curso e datas costumam bastar.
- Desenhe seu fluxo de agentes como caixas e setas. Corte toda seta que não carrega dado: esses passos podem rodar em paralelo.
- Dê a cada etapa um contrato: entrada explícita e saída validada por esquema.
- Coloque um verificador separado antes do resultado final, com critérios escritos e um limite de tentativas.
- Use código comum para juntar, filtrar e deduplicar; guarde os modelos para as decisões que exigem julgamento.
- Revise o harness quando trocar de modelo: peças que compensavam limitações antigas podem sair.
09Glossário
- Aresta Edge
- Dado que sai de um nó e entra em outro; sem dado passando, não há aresta.
- Barreira Barrier
- Ponto em que o fluxo espera todas as tarefas paralelas terminarem.
- Contrato de nó Node contract
- Entrada explícita e saída com formato validado, geralmente por esquema.
- Diamante Diamond (fan-out/fan-in)
- Topologia que divide o trabalho, roda em paralelo e junta no fim.
- Duração da tarefa (50%) 50% time horizon
- Tempo humano das tarefas que um modelo conclui com 50% de sucesso.
- Harness Agent harness
- Todo o código e a configuração em volta do modelo que o fazem agir.
- Leque Fan-out
- Disparar várias tarefas independentes ao mesmo tempo.
- Nó Node
- Unidade de trabalho com uma entrada, uma saída e uma única tarefa.
- Pipeline Pipeline
- Cada item passa pelas etapas sem esperar os demais.
- Subagente Subagent
- Agente com contexto próprio disparado por outro agente ou script.
- Verificador Verifier
- Etapa que tenta derrubar um resultado antes de ele seguir adiante.
- Workflow dinâmico Dynamic workflow
- Script que o Claude Code escreve para orquestrar muitos subagentes.
10Quiz
Qual é a fonte real do vídeo do post?
- a) Um curso pago de harness engineering
- b) A aula de carreira do Stanford CS230 de 18/nov/2025
- c) Uma palestra de Ng sobre grafos de agentes
- d) Um evento da Anthropic
Ver resposta ›
b) Lecture 9: Career Advice in AI, publicada pelo Stanford Online [1].
De onde vêm os "7 meses" do post?
- a) De uma previsão de Ng sobre o fim do prompt
- b) Do tempo de duplicação, medido pelo METR, da duração das tarefas que a IA conclui
- c) Do prazo de lançamento de um modelo
- d) De nenhuma fonte
Quanto tempo Ng fala no vídeo de 98 minutos?
- a) Os 98 minutos
- b) Cerca de 60 minutos
- c) Cerca de 15 minutos
- d) Não aparece
Ver resposta ›
c) O restante é de Laurence Moroney [1].
Qual a diferença entre parallel() e pipeline() nos workflows do Claude Code?
- a) Nenhuma
- b) parallel() espera todas as tarefas (barreira); pipeline() deixa cada item seguir sozinho pelas etapas
- c) pipeline() só roda uma tarefa por vez
- d) parallel() não usa subagentes
Por que deduplicar contra "tudo o que já foi visto" num ciclo de busca de bugs?
Ver resposta ›
porque, se você deduplicar só contra os achados confirmados, os rejeitados voltam a cada rodada e o laço nunca chega às rodadas vazias que o encerram [3].
O prompt morre num sistema com harness?
11Flashcards
Toque no cartão para virar. Baixar CSV para o Anki › (separador “;”, colunas frente;verso;tags)
12Exercício aplicado
Tarefa (30 min): pegue um fluxo que você já faz com IA em vários passos (pesquisar e resumir, revisar um texto, triar mensagens). Desenhe cada passo como caixa e cada dado que passa como seta. Marque as setas que não carregam dado, reagrupe os passos independentes em paralelo, escreva o formato de saída de cada caixa e acrescente um verificador com 3 critérios antes do resultado final.
Feito quando: você tem o desenho antes e depois, pelo menos um par de passos que agora roda em paralelo, um formato de saída por caixa e 3 critérios de verificação que outra pessoa conseguiria aplicar sem perguntar nada.
13Leituras
- Stanford CS230, aula 9: Career Advice in AI · vídeo · iniciante · a aula completa, sem os cortes e legendas do post [1].
- Measuring AI Ability to Complete Long Tasks (METR) · artigo · intermediário · de onde vem o gráfico dos 7 meses [4].
- Harness engineering (OpenAI) · artigo · intermediário · um time que só escreve o ambiente dos agentes [10].
- Harness design for long-running application development (Anthropic) · artigo · avançado · planejador, gerador e avaliador [11].
- Dynamic workflows (Claude Code) · documentação · intermediário · como grafos de subagentes funcionam na prática [8].
14Fontes
- Stanford Online. Stanford CS230 | Autumn 2025 | Lecture 9: Career Advice in AI (Andrew Ng, Laurence Moroney, Kian Katanforoosh), aula de 18/nov/2025, publicada em 16/dez/2025. https://www.youtube.com/watch?v=AuZoDsNmG_s · fonte primária · acessado em 04/out/2026.
- @0xnicc0. Post com o vídeo, 04/out/2026. https://x.com/0xnicc0/status/2106741374028578913 · ponto de partida · acessado em 04/out/2026.
- @seeconvm. Graph Engineering: Stop Chaining Your Agents (artigo no X), 14/ago/2026. https://x.com/seeconvm/status/2088199384580108339 · citado no post · acessado em 04/out/2026.
- METR. Measuring AI Ability to Complete Long Tasks, 19/mar/2025. https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/ · independente · acessado em 04/out/2026.
- METR. Time Horizon 1.1, 29/jan/2026. https://metr.org/blog/2026-1-29-time-horizon-1-1/ · independente, atualização · acessado em 04/out/2026.
- Hacker News. Prompting Is Dead in 6 Months. Andrew Ng, Stanford [video] (discussão), set/2026. https://news.ycombinator.com/item?id=49605222 · independente · acessado em 04/out/2026.
- TIMEWELL. What Graph Engineering Actually Is: Tracing a Viral Quote to Its Source, 09/ago/2026. https://timewell.jp/en/columns/graph-engineering-explained · independente · acessado em 04/out/2026.
- Anthropic. Orchestrate subagents at scale with dynamic workflows (documentação do Claude Code), sem data. https://code.claude.com/docs/en/workflows · documentação · acessado em 04/out/2026.
- Anthropic. Orchestrate subagents at scale with dynamic workflows (Claude Cookbook), sem data. https://platform.claude.com/cookbook/claude-agent-sdk-08-dynamic-workflows · documentação · acessado em 04/out/2026.
- Lopopolo, R. (OpenAI). Harness engineering: leveraging Codex in an agent-first world, 11/fev/2026. https://openai.com/index/harness-engineering/ · independente · acessado em 04/out/2026.
- Anthropic. Harness design for long-running application development, 24/mar/2026. https://www.anthropic.com/engineering/harness-design-long-running-apps · independente · acessado em 04/out/2026.
- Osmani, A. Agent Harness Engineering. O'Reilly Radar, 15/mai/2026. https://www.oreilly.com/radar/agent-harness-engineering/ · independente · acessado em 04/out/2026.
- Ng, A. Andrew Ng: Official Website, sem data. https://www.andrewng.org/ · biografia oficial · acessado em 04/out/2026.
15Ficha técnica
- Post original: @0xnicc0, 04/out/2026 · Aula original: Stanford Online
- Preparado em: 04/out/2026 pelo agente 📚 Estudos, a partir da captura integral do post e do artigo citado, de quadros do vídeo e de uma transcrição automática do áudio (modelo de reconhecimento de fala rodado localmente).
- Última verificação das fontes: 04/out/2026.
- Método: recorte comparado com a aula oficial (data, duração, palestrantes, slides); busca das palavras "prompt", "harness", "graph" e "seven months" na transcrição; afirmações do artigo citado conferidas na documentação oficial.
- Limites conhecidos: transcrição automática com falhas em trechos de áudio ruim; minutos referentes ao recorte do post.
- Validade: checagem estável; recursos do Claude Code e números do METR, revisar a cada 6 meses.