How I use LLMs, de Andrej Karpathy (fev/2025)
- Um LLM é um "zip" com perdas da internet: sabe o que é frequente e antigo, erra o raro e o recente.
- O uso profissional depende de escolher a ferramenta certa: modelo de raciocínio, busca, deep research, Python, arquivos e voz.
- O vídeo é de 27/fev/2025; o post do X que o vendeu como palestra nova sobre agentes estava errado.
Sumário · 15 seções
01Post original
- Link: x.com/callanxai/status/2104307118236971380 [2]
- Autor do post: @callanxai (nome exibido: "Callan"), conta de dicas de IA que republica vídeos de terceiros.
- Publicado em: 27/set/2026, 17:28 (horário de Brasília) · cerca de 830 curtidas na leitura de 04/out/2026.
- Texto (tradução): "Andrej Karpathy passou 8 anos na OpenAI e na Tesla. Na semana passada, ele condensou tudo o que sabe numa aula gratuita de 2 horas. Agentes → Loops → Grafos → Sistemas que se autoaprimoram. Tem gente que paga US$ 25 mil em bootcamps que ensinam menos do que isso."
- Notas da comunidade: nenhuma neste post. Um post quase idêntico de outra conta (17/ago/2026) recebeu nota avisando que o vídeo é de 27/fev/2025 [3].
02Contexto
Quem fala. Andrej Karpathy, cofundador da OpenAI e ex-líder de IA da Tesla, criou o termo vibe coding em fev/2025 [5]. Neste vídeo ele não dá aula: grava a própria tela mostrando como usa ChatGPT, Claude, Gemini, Grok, Perplexity, Cursor e NotebookLM [1].
Onde nasceu o conteúdo. No canal dele no YouTube, publicado em 27/fev/2025, com 2h11min e capítulos oficiais [1]. É a continuação prática do vídeo "Deep Dive into LLMs" da mesma série para público geral.
Por que circula agora. Em ago e set/2026, várias contas usaram a mesma fórmula: vídeo antigo de Karpathy, legenda dizendo "semana passada" e uma lista de temas (agentes, loops, grafos) que não aparece no vídeo. Uma análise independente mostrou que os temas vinham de um artigo promovido pelas próprias contas [3].
03Afirmações × Realidade
"Na semana passada" (post de 27/set/2026)
Publicado em 27/fev/2025 [1]; outra versão do mesmo post recebeu nota da comunidade com essa data [3].
Cobre "agentes → loops → grafos → sistemas que se autoaprimoram"
Os capítulos oficiais tratam de uso de apps, ferramentas e modalidades; esses temas não aparecem [1][3].
Deep Research exige o plano de US$ 200/mês (dito no vídeo)
Era verdade na gravação [1]; desde 24/abr/2025 Plus tem 25 consultas/mês e o plano gratuito, 5 [4].
O ChatGPT errou uma extrapolação (US$ 1,7 tri em vez de ~US$ 20 tri)
O próprio vídeo mostra o erro e a correção, como alerta para revisar o código gerado [1].
Legenda: ✅ confirmado por fonte independente · ⚠️ parcial ou exagerado · ❌ contradito · ❓ sem fonte.
04Verificação
- Fonte primária: o vídeo no canal de Karpathy, com transcrição, capítulos e data [1].
- Independente 1: análise da SparkOne (07/set/2026) sobre os posts que revenderam o vídeo como novo, com a nota da comunidade [3].
- Independente 2: página da OpenAI sobre o deep research, com o histórico de mudanças de acesso [4].
- Independente 3: página da OpenAI sobre o GPT-5, para checar a troca de modelos desde a gravação [6].
- Independente 4: verbete "Vibe coding" na Wikipédia, para a origem do termo [5].
O que mudou desde fev/2025 (checado em 04/out/2026):
- Modelos: os nomes citados no vídeo (GPT-4o, o1 pro, Claude 3.7) foram substituídos. O GPT-5 foi lançado em 07/ago/2025 com "raciocínio embutido", o que reduz a escolha manual entre modelo comum e modelo de raciocínio; a página da OpenAI já aponta um sucessor, o GPT-6 [6].
- Deep research saiu do plano de US$ 200: desde 24/abr/2025, Plus, Team, Enterprise e Edu têm 25 consultas por mês, Pro tem 250 e o gratuito, 5. Em 10/fev/2026 passou a aceitar conexão com apps e MCP e a restringir buscas a sites confiáveis [4].
- Vibe coding virou palavra do ano: o termo entrou como gíria no Merriam-Webster em mar/2025 e foi eleito palavra do ano de 2025 pelo dicionário Collins [5].
- O que não mudou: contexto curto, ferramenta certa e verificação continuam sendo os conselhos centrais.
Limites. Preços e limites de planos mudam com frequência; confira a página do fornecedor antes de decidir.
05Mapa do conteúdo
- 00:00–13:12 · Ecossistema de LLMs e o que acontece por baixo do chat: tokens, janela de contexto, pré-treino e pós-treino [1].
- 13:12–22:54 · Exemplos básicos; saber qual modelo e qual plano você está usando.
- 22:54–31:00 · Modelos de raciocínio (thinking) e quando vale esperar.
- 31:00–50:57 · Ferramentas: busca na internet e deep research.
- 50:57–59:00 · Arquivos no contexto: PDFs, papers e leitura de livros com o LLM.
- 59:00–1:22:28 · Código como ferramenta: Python, análise de dados, Claude Artifacts, Cursor.
- 1:22:28–1:53:29 · Voz, áudio nativo, NotebookLM, imagem e vídeo na entrada e na saída.
- 1:53:29–2:11:12 · Memória, instruções personalizadas, GPTs personalizados e resumo final.
Tempos dos capítulos oficiais do vídeo [1].
06Conceitos-chave
1. O "zip da internet"
- Em uma frase: um LLM é como um arquivo zip de cerca de 1 TB, com perdas, que comprime a internet em cerca de 1 trilhão de parâmetros [1].
- Explicação: o pré-treino custa dezenas de milhões de dólares e meses, por isso é raro e gera a data de corte do conhecimento. O pós-treino dá a "personalidade" de assistente a partir de conversas escritas por pessoas. Sem ferramentas, o modelo não calcula, não navega e não roda código: só prevê o próximo token.
- Exemplo do vídeo (~10:00): a cafeína de um shot de americano (~63 mg) é pergunta segura, porque é frequente e não mudou; mesmo assim ele confere na fonte.
- Erro comum: perguntar ao modelo sem busca sobre algo da semana passada.
2. Contexto é memória de trabalho
- Em uma frase: tudo o que está na janela de contexto fica diretamente acessível ao modelo; "nova conversa" zera essa memória.
- Explicação: tokens antigos distraem o modelo e deixam cada resposta um pouco mais lenta e cara. Por isso ele abre uma conversa nova a cada assunto.
- Erro comum: manter uma conversa gigante "porque o modelo já sabe tudo". Ele se distrai.
3. Modelos de raciocínio
- Explicação (~23:00): um terceiro estágio de treino, por reforço, faz o modelo praticar milhares de problemas e descobrir estratégias de raciocínio. Vale para matemática e código; em perguntas simples só adiciona espera. Fluxo dele: começar com o modelo rápido e trocar se a resposta decepcionar [1].
- Exemplo do vídeo: um bug de gradient check que o GPT-4o não resolveu e o o1 pro resolveu em cerca de 1 minuto.
- Hoje: com o GPT-5, o próprio sistema decide quando pensar mais [6].
4. Busca e deep research
- Busca: o modelo emite um pedido de busca, o app visita páginas e cola o texto no contexto; a resposta vem com citações. Use para informação recente ou de nicho, e sempre abra as citações [1].
- Deep research: busca + raciocínio por dezenas de minutos, gerando um relatório com dezenas de fontes. No teste dele, levou 5 min e usou 27 fontes; numa tabela de laboratórios de IA nos EUA, omitiu a xAI e incluiu nomes que não deveriam estar lá. Trate como primeiro rascunho [1].
5. Código como ferramenta
- Python: para conta difícil, o modelo escreve e roda um programa em vez de "chutar". Sem essa ferramenta, modelos erram multiplicações grandes por pouco [1].
- Analista júnior distraído: na análise de dados, o ChatGPT assumiu um valor para 2015 sem avisar e anunciou US$ 1,7 trilhão para 2030 quando o próprio gráfico indicava cerca de US$ 20 trilhões. Lição: leia o código e confira os números [1].
- Cursor e vibe coding: o LLM edita os arquivos do projeto com o contexto do diretório inteiro; se der errado, volte a programar na mão [1][5].
6. Multimodalidade
- Áudio "falso" e "verdadeiro": transcrever a voz para texto (metade das perguntas dele) é diferente do modo de voz avançado, em que o modelo ouve e fala em tokens de áudio [1].
- Imagem na entrada em dois passos: primeiro peça a transcrição e confira a leitura; depois faça as perguntas.
- NotebookLM: gera um podcast sob medida a partir de PDFs e links, útil para temas de nicho.
7. Qualidade de vida
- Memória e instruções personalizadas moldam o assistente; GPTs personalizados são prompts salvos, melhores com exemplos concretos (few-shot) [1].
07Conexões
- Pré-requisito recomendado: Transformers, por Andrej Karpathy (Stanford CS25, 2023), para entender tokens, contexto e por que o modelo prevê o próximo token.
- Próximo passo na trilha: Agentes de IA, segundo Andrew Ng: da ideia ao sistema mostra como encadear essas ferramentas num fluxo com avaliação.
- Relacionado: Code w/ Claude: 8 palestras sobre programar com agentes aprofunda o uso de LLM para programar (o "Cursor" deste vídeo, versão 2026). Como a economia funciona, segundo Ray Dalio (palestra de 2019) é um bom caso para praticar busca: atualizar números de uma palestra antiga.
08Aplicações práticas
- Abra uma conversa nova a cada assunto e mantenha o contexto curto.
- Para qualquer número recente, peça busca e abra pelo menos duas citações.
- Use deep research para mapear um tema e listar o que ler, nunca como resposta final.
- Peça ao modelo que use código para contas e gráficos, e leia o código.
- Fotografe documentos e peça primeiro a transcrição, depois a análise.
- Monte um "conselho de LLMs": a mesma pergunta em dois ou três modelos antes de decidir algo importante.
09Glossário
- Data de corte Knowledge cutoff
- Último ponto do tempo coberto pelo pré-treino do modelo.
- Deep research Deep research
- Modo que combina busca e raciocínio por minutos e entrega um relatório com fontes.
- Few-shot Few-shot prompting
- Dar alguns exemplos no prompt para orientar a resposta.
- Janela de contexto Context window
- Conjunto de tokens que o modelo enxerga naquela conversa.
- Modelo de raciocínio Thinking / reasoning model
- Modelo treinado por reforço para "pensar" antes de responder.
- Modo de voz avançado Advanced Voice Mode
- Conversa em que o modelo processa e gera áudio diretamente.
- Pós-treino Post-training
- Etapa que transforma o modelo base em assistente.
- Pré-treino Pre-training
- Etapa cara em que o modelo comprime grandes volumes de texto.
- Token Token
- Pedaço de texto convertido em número; unidade de entrada e saída.
- Vibe coding Vibe coding
- Programar descrevendo o que se quer e deixando o LLM escrever o código.
10Quiz
Por que Karpathy compara o LLM a um arquivo zip?
- a) Porque ele é pequeno
- b) Porque comprime a internet com perdas e lembra vagamente
- c) Porque só lê arquivos compactados
- d) Porque é open source
Ver resposta ›
b) O "zip" é probabilístico: lembra bem o frequente e mal o raro [1].
Quando faz sentido ligar um modelo de raciocínio?
- a) Para qualquer pergunta
- b) Para problemas difíceis de matemática, lógica ou código
- c) Só para traduzir
- d) Nunca, porque é mais lento
Ver resposta ›
b) Em perguntas simples ele só adiciona espera [1].
Qual é a atitude certa diante de um relatório de deep research?
- a) Copiar e publicar
- b) Tratar como primeiro rascunho e conferir as fontes
- c) Ignorar as citações
- d) Pedir para o modelo jurar que está certo
Ver resposta ›
b) No teste do vídeo, a tabela tinha omissões e nomes errados [1].
O que mudou no acesso ao deep research desde a gravação?
- a) Nada
- b) Passou a existir em Plus (25/mês) e no gratuito (5/mês) desde abr/2025
- c) Foi descontinuado
- d) Só existe na API
Ver resposta ›
b) Atualização de 24/abr/2025 [4].
Por que abrir uma conversa nova ao mudar de assunto?
Ver resposta ›
tokens antigos distraem o modelo e deixam cada resposta mais lenta e cara; a janela de contexto é recurso precioso [1].
Qual foi o erro da análise de dados mostrado no vídeo?
Ver resposta ›
o ChatGPT assumiu um valor para 2015 sem avisar e anunciou US$ 1,7 tri para 2030, quando o gráfico indicava ~US$ 20 tri. Lição: leia o código e confira os números [1].
11Flashcards
Toque no cartão para virar. Baixar CSV para o Anki › (separador “;”, colunas frente;verso;tags)
12Exercício aplicado
Tarefa (20 min): escolha uma pergunta recente do seu trabalho (um número de mercado, uma regra nova, um lançamento). Faça a mesma pergunta em dois assistentes: uma vez sem busca e outra com busca. Anote as diferenças, abra duas citações da versão com busca e marque o que estava errado ou desatualizado na versão sem busca.
Feito quando: você tem uma tabela com a resposta sem busca, a resposta com busca, duas citações abertas e pelo menos uma diferença explicada.
13Leituras
- Vídeo original no YouTube · vídeo · iniciante · use os capítulos para ir direto ao tema [1].
- Introducing deep research · página oficial · iniciante · histórico de acesso e limitações [4].
- Introducing GPT-5 · página oficial · iniciante · como a escolha de modelo mudou [6].
- Análise da SparkOne · artigo · iniciante · como identificar posts que revendem vídeos antigos [3].
14Fontes
- Karpathy, A. How I use LLMs. YouTube, 27/fev/2025, 2h11min12s. https://www.youtube.com/watch?v=EWvNQjAaOHw · fonte primária · acessado em 04/out/2026.
- @callanxai. Post com o vídeo, 27/set/2026. https://x.com/callanxai/status/2104307118236971380 · ponto de partida · acessado em 04/out/2026.
- Vonk, J. The thread said last week. The lecture is eighteen months old. SparkOne, 07/set/2026. https://sparkone.nl/en/blog/karpathy-lecture-sold-as-news/ · independente · acessado em 04/out/2026.
- OpenAI. Introducing deep research, 02/fev/2025 (atualizações de 24/abr/2025 e 10/fev/2026). https://openai.com/index/introducing-deep-research/ · independente · acessado em 04/out/2026.
- Wikipédia. Vibe coding. https://en.wikipedia.org/wiki/Vibe_coding · independente · acessado em 04/out/2026.
- OpenAI. Introducing GPT-5, 07/ago/2025. https://openai.com/index/introducing-gpt-5/ · independente · acessado em 04/out/2026.
15Ficha técnica
- Post original: @callanxai, 27/set/2026 · Mídia oficial: YouTube de Karpathy
- Preparado em: 04/out/2026 pelo agente 📚 Estudos, a partir de um resumo anterior de 27/set/2026 e da transcrição do vídeo.
- Última verificação das fontes: 04/out/2026.
- Método: transcrição integral comparada com os capítulos oficiais; mudanças de produto checadas nas páginas da OpenAI.
- Limites conhecidos: o vídeo compara apps cujos recursos mudam todo mês; tempos sem capítulo são aproximados.
- Validade: princípios estáveis; nomes de modelos e planos, revisar a cada 6 meses.