EstudosTodos os materiais ›
Estudos›inteligência artificial

How I use LLMs, de Andrej Karpathy (fev/2025)

Vídeo (screencast) · 2h11 · Andrej Karpathy · original de 27/fev/2025 · Nível: iniciante · ⏱ 13 min de leitura

Preparado em 04/out/2026 · 6 fontes · Post original no X ›

TL;DR
  • Um LLM é um "zip" com perdas da internet: sabe o que é frequente e antigo, erra o raro e o recente.
  • O uso profissional depende de escolher a ferramenta certa: modelo de raciocínio, busca, deep research, Python, arquivos e voz.
  • O vídeo é de 27/fev/2025; o post do X que o vendeu como palestra nova sobre agentes estava errado.
Sumário · 15 seções
  1. Post original
  2. Contexto
  3. Afirmações × Realidade
  4. Verificação
  5. Mapa do conteúdo
  6. Conceitos-chave
  7. Conexões
  8. Aplicações práticas
  9. Glossário
  10. Quiz
  11. Flashcards
  12. Exercício aplicado
  13. Leituras
  14. Fontes
  15. Ficha técnica

01Post original

  • Link: x.com/callanxai/status/2104307118236971380 [2]
  • Autor do post: @callanxai (nome exibido: "Callan"), conta de dicas de IA que republica vídeos de terceiros.
  • Publicado em: 27/set/2026, 17:28 (horário de Brasília) · cerca de 830 curtidas na leitura de 04/out/2026.
  • Texto (tradução): "Andrej Karpathy passou 8 anos na OpenAI e na Tesla. Na semana passada, ele condensou tudo o que sabe numa aula gratuita de 2 horas. Agentes → Loops → Grafos → Sistemas que se autoaprimoram. Tem gente que paga US$ 25 mil em bootcamps que ensinam menos do que isso."
  • Notas da comunidade: nenhuma neste post. Um post quase idêntico de outra conta (17/ago/2026) recebeu nota avisando que o vídeo é de 27/fev/2025 [3].

02Contexto

Quem fala. Andrej Karpathy, cofundador da OpenAI e ex-líder de IA da Tesla, criou o termo vibe coding em fev/2025 [5]. Neste vídeo ele não dá aula: grava a própria tela mostrando como usa ChatGPT, Claude, Gemini, Grok, Perplexity, Cursor e NotebookLM [1].

Onde nasceu o conteúdo. No canal dele no YouTube, publicado em 27/fev/2025, com 2h11min e capítulos oficiais [1]. É a continuação prática do vídeo "Deep Dive into LLMs" da mesma série para público geral.

Por que circula agora. Em ago e set/2026, várias contas usaram a mesma fórmula: vídeo antigo de Karpathy, legenda dizendo "semana passada" e uma lista de temas (agentes, loops, grafos) que não aparece no vídeo. Uma análise independente mostrou que os temas vinham de um artigo promovido pelas próprias contas [3].

03Afirmações × Realidade

❌ Contradito#1

"Na semana passada" (post de 27/set/2026)

Publicado em 27/fev/2025 [1]; outra versão do mesmo post recebeu nota da comunidade com essa data [3].

❌ Contradito#2

Cobre "agentes → loops → grafos → sistemas que se autoaprimoram"

Os capítulos oficiais tratam de uso de apps, ferramentas e modalidades; esses temas não aparecem [1][3].

⚠️ Parcial#3

É uma "aula"

É um screencast em que ele mostra o próprio uso, não uma palestra [1].

⚠️ Desatualizado#4

Deep Research exige o plano de US$ 200/mês (dito no vídeo)

Era verdade na gravação [1]; desde 24/abr/2025 Plus tem 25 consultas/mês e o plano gratuito, 5 [4].

✅ Confirmado#5

O ChatGPT errou uma extrapolação (US$ 1,7 tri em vez de ~US$ 20 tri)

O próprio vídeo mostra o erro e a correção, como alerta para revisar o código gerado [1].

Legenda: ✅ confirmado por fonte independente · ⚠️ parcial ou exagerado · ❌ contradito · ❓ sem fonte.

04Verificação

  • Fonte primária: o vídeo no canal de Karpathy, com transcrição, capítulos e data [1].
  • Independente 1: análise da SparkOne (07/set/2026) sobre os posts que revenderam o vídeo como novo, com a nota da comunidade [3].
  • Independente 2: página da OpenAI sobre o deep research, com o histórico de mudanças de acesso [4].
  • Independente 3: página da OpenAI sobre o GPT-5, para checar a troca de modelos desde a gravação [6].
  • Independente 4: verbete "Vibe coding" na Wikipédia, para a origem do termo [5].

O que mudou desde fev/2025 (checado em 04/out/2026):

  • Modelos: os nomes citados no vídeo (GPT-4o, o1 pro, Claude 3.7) foram substituídos. O GPT-5 foi lançado em 07/ago/2025 com "raciocínio embutido", o que reduz a escolha manual entre modelo comum e modelo de raciocínio; a página da OpenAI já aponta um sucessor, o GPT-6 [6].
  • Deep research saiu do plano de US$ 200: desde 24/abr/2025, Plus, Team, Enterprise e Edu têm 25 consultas por mês, Pro tem 250 e o gratuito, 5. Em 10/fev/2026 passou a aceitar conexão com apps e MCP e a restringir buscas a sites confiáveis [4].
  • Vibe coding virou palavra do ano: o termo entrou como gíria no Merriam-Webster em mar/2025 e foi eleito palavra do ano de 2025 pelo dicionário Collins [5].
  • O que não mudou: contexto curto, ferramenta certa e verificação continuam sendo os conselhos centrais.

Limites. Preços e limites de planos mudam com frequência; confira a página do fornecedor antes de decidir.

05Mapa do conteúdo

  1. 00:00–13:12 · Ecossistema de LLMs e o que acontece por baixo do chat: tokens, janela de contexto, pré-treino e pós-treino [1].
  2. 13:12–22:54 · Exemplos básicos; saber qual modelo e qual plano você está usando.
  3. 22:54–31:00 · Modelos de raciocínio (thinking) e quando vale esperar.
  4. 31:00–50:57 · Ferramentas: busca na internet e deep research.
  5. 50:57–59:00 · Arquivos no contexto: PDFs, papers e leitura de livros com o LLM.
  6. 59:00–1:22:28 · Código como ferramenta: Python, análise de dados, Claude Artifacts, Cursor.
  7. 1:22:28–1:53:29 · Voz, áudio nativo, NotebookLM, imagem e vídeo na entrada e na saída.
  8. 1:53:29–2:11:12 · Memória, instruções personalizadas, GPTs personalizados e resumo final.

Tempos dos capítulos oficiais do vídeo [1].

06Conceitos-chave

1. O "zip da internet"

  • Em uma frase: um LLM é como um arquivo zip de cerca de 1 TB, com perdas, que comprime a internet em cerca de 1 trilhão de parâmetros [1].
  • Explicação: o pré-treino custa dezenas de milhões de dólares e meses, por isso é raro e gera a data de corte do conhecimento. O pós-treino dá a "personalidade" de assistente a partir de conversas escritas por pessoas. Sem ferramentas, o modelo não calcula, não navega e não roda código: só prevê o próximo token.
  • Exemplo do vídeo (~10:00): a cafeína de um shot de americano (~63 mg) é pergunta segura, porque é frequente e não mudou; mesmo assim ele confere na fonte.
  • Erro comum: perguntar ao modelo sem busca sobre algo da semana passada.
Frequente, antigo, baixo riscopode confiar no "zip" (e conferir) Recente ou de nichobusca na internet / deep research Conta, tabela, gráficoPython / análise de dados Problema difícil de lógica ou códigomodelo de raciocínio
Escolha da ferramenta, segundo o raciocínio do vídeo.

2. Contexto é memória de trabalho

  • Em uma frase: tudo o que está na janela de contexto fica diretamente acessível ao modelo; "nova conversa" zera essa memória.
  • Explicação: tokens antigos distraem o modelo e deixam cada resposta um pouco mais lenta e cara. Por isso ele abre uma conversa nova a cada assunto.
  • Erro comum: manter uma conversa gigante "porque o modelo já sabe tudo". Ele se distrai.

3. Modelos de raciocínio

  • Explicação (~23:00): um terceiro estágio de treino, por reforço, faz o modelo praticar milhares de problemas e descobrir estratégias de raciocínio. Vale para matemática e código; em perguntas simples só adiciona espera. Fluxo dele: começar com o modelo rápido e trocar se a resposta decepcionar [1].
  • Exemplo do vídeo: um bug de gradient check que o GPT-4o não resolveu e o o1 pro resolveu em cerca de 1 minuto.
  • Hoje: com o GPT-5, o próprio sistema decide quando pensar mais [6].

4. Busca e deep research

  • Busca: o modelo emite um pedido de busca, o app visita páginas e cola o texto no contexto; a resposta vem com citações. Use para informação recente ou de nicho, e sempre abra as citações [1].
  • Deep research: busca + raciocínio por dezenas de minutos, gerando um relatório com dezenas de fontes. No teste dele, levou 5 min e usou 27 fontes; numa tabela de laboratórios de IA nos EUA, omitiu a xAI e incluiu nomes que não deveriam estar lá. Trate como primeiro rascunho [1].

5. Código como ferramenta

  • Python: para conta difícil, o modelo escreve e roda um programa em vez de "chutar". Sem essa ferramenta, modelos erram multiplicações grandes por pouco [1].
  • Analista júnior distraído: na análise de dados, o ChatGPT assumiu um valor para 2015 sem avisar e anunciou US$ 1,7 trilhão para 2030 quando o próprio gráfico indicava cerca de US$ 20 trilhões. Lição: leia o código e confira os números [1].
  • Cursor e vibe coding: o LLM edita os arquivos do projeto com o contexto do diretório inteiro; se der errado, volte a programar na mão [1][5].

6. Multimodalidade

  • Áudio "falso" e "verdadeiro": transcrever a voz para texto (metade das perguntas dele) é diferente do modo de voz avançado, em que o modelo ouve e fala em tokens de áudio [1].
  • Imagem na entrada em dois passos: primeiro peça a transcrição e confira a leitura; depois faça as perguntas.
  • NotebookLM: gera um podcast sob medida a partir de PDFs e links, útil para temas de nicho.

7. Qualidade de vida

  • Memória e instruções personalizadas moldam o assistente; GPTs personalizados são prompts salvos, melhores com exemplos concretos (few-shot) [1].

07Conexões

08Aplicações práticas

  • Abra uma conversa nova a cada assunto e mantenha o contexto curto.
  • Para qualquer número recente, peça busca e abra pelo menos duas citações.
  • Use deep research para mapear um tema e listar o que ler, nunca como resposta final.
  • Peça ao modelo que use código para contas e gráficos, e leia o código.
  • Fotografe documentos e peça primeiro a transcrição, depois a análise.
  • Monte um "conselho de LLMs": a mesma pergunta em dois ou três modelos antes de decidir algo importante.

09Glossário

Data de corte Knowledge cutoff
Último ponto do tempo coberto pelo pré-treino do modelo.
Deep research Deep research
Modo que combina busca e raciocínio por minutos e entrega um relatório com fontes.
Few-shot Few-shot prompting
Dar alguns exemplos no prompt para orientar a resposta.
Janela de contexto Context window
Conjunto de tokens que o modelo enxerga naquela conversa.
Modelo de raciocínio Thinking / reasoning model
Modelo treinado por reforço para "pensar" antes de responder.
Modo de voz avançado Advanced Voice Mode
Conversa em que o modelo processa e gera áudio diretamente.
Pós-treino Post-training
Etapa que transforma o modelo base em assistente.
Pré-treino Pre-training
Etapa cara em que o modelo comprime grandes volumes de texto.
Token Token
Pedaço de texto convertido em número; unidade de entrada e saída.
Vibe coding Vibe coding
Programar descrevendo o que se quer e deixando o LLM escrever o código.

10Quiz

  1. Por que Karpathy compara o LLM a um arquivo zip?

    • a) Porque ele é pequeno
    • b) Porque comprime a internet com perdas e lembra vagamente
    • c) Porque só lê arquivos compactados
    • d) Porque é open source
    Ver resposta ›

    b) O "zip" é probabilístico: lembra bem o frequente e mal o raro [1].

  2. Quando faz sentido ligar um modelo de raciocínio?

    • a) Para qualquer pergunta
    • b) Para problemas difíceis de matemática, lógica ou código
    • c) Só para traduzir
    • d) Nunca, porque é mais lento
    Ver resposta ›

    b) Em perguntas simples ele só adiciona espera [1].

  3. Qual é a atitude certa diante de um relatório de deep research?

    • a) Copiar e publicar
    • b) Tratar como primeiro rascunho e conferir as fontes
    • c) Ignorar as citações
    • d) Pedir para o modelo jurar que está certo
    Ver resposta ›

    b) No teste do vídeo, a tabela tinha omissões e nomes errados [1].

  4. O que mudou no acesso ao deep research desde a gravação?

    • a) Nada
    • b) Passou a existir em Plus (25/mês) e no gratuito (5/mês) desde abr/2025
    • c) Foi descontinuado
    • d) Só existe na API
    Ver resposta ›

    b) Atualização de 24/abr/2025 [4].

  5. Por que abrir uma conversa nova ao mudar de assunto?

    Ver resposta ›

    tokens antigos distraem o modelo e deixam cada resposta mais lenta e cara; a janela de contexto é recurso precioso [1].

  6. Qual foi o erro da análise de dados mostrado no vídeo?

    Ver resposta ›

    o ChatGPT assumiu um valor para 2015 sem avisar e anunciou US$ 1,7 tri para 2030, quando o gráfico indicava ~US$ 20 tri. Lição: leia o código e confira os números [1].

11Flashcards

Toque no cartão para virar. Baixar CSV para o Anki › (separador “;”, colunas frente;verso;tags)

12Exercício aplicado

Tarefa (20 min): escolha uma pergunta recente do seu trabalho (um número de mercado, uma regra nova, um lançamento). Faça a mesma pergunta em dois assistentes: uma vez sem busca e outra com busca. Anote as diferenças, abra duas citações da versão com busca e marque o que estava errado ou desatualizado na versão sem busca.

Feito quando: você tem uma tabela com a resposta sem busca, a resposta com busca, duas citações abertas e pelo menos uma diferença explicada.

13Leituras

14Fontes

  1. Karpathy, A. How I use LLMs. YouTube, 27/fev/2025, 2h11min12s. https://www.youtube.com/watch?v=EWvNQjAaOHw · fonte primária · acessado em 04/out/2026.
  2. @callanxai. Post com o vídeo, 27/set/2026. https://x.com/callanxai/status/2104307118236971380 · ponto de partida · acessado em 04/out/2026.
  3. Vonk, J. The thread said last week. The lecture is eighteen months old. SparkOne, 07/set/2026. https://sparkone.nl/en/blog/karpathy-lecture-sold-as-news/ · independente · acessado em 04/out/2026.
  4. OpenAI. Introducing deep research, 02/fev/2025 (atualizações de 24/abr/2025 e 10/fev/2026). https://openai.com/index/introducing-deep-research/ · independente · acessado em 04/out/2026.
  5. Wikipédia. Vibe coding. https://en.wikipedia.org/wiki/Vibe_coding · independente · acessado em 04/out/2026.
  6. OpenAI. Introducing GPT-5, 07/ago/2025. https://openai.com/index/introducing-gpt-5/ · independente · acessado em 04/out/2026.

15Ficha técnica

  • Post original: @callanxai, 27/set/2026 · Mídia oficial: YouTube de Karpathy
  • Preparado em: 04/out/2026 pelo agente 📚 Estudos, a partir de um resumo anterior de 27/set/2026 e da transcrição do vídeo.
  • Última verificação das fontes: 04/out/2026.
  • Método: transcrição integral comparada com os capítulos oficiais; mudanças de produto checadas nas páginas da OpenAI.
  • Limites conhecidos: o vídeo compara apps cujos recursos mudam todo mês; tempos sem capítulo são aproximados.
  • Validade: princípios estáveis; nomes de modelos e planos, revisar a cada 6 meses.