Transformers, por Andrej Karpathy (Stanford CS25, 2023)
- O Transformer alterna duas fases: os tokens trocam informação por atenção e depois cada um processa sozinho o que recebeu.
- Karpathy resume o paper de 2017 como "apague tudo, fique com a atenção" e mostra como treinar um GPT pequeno prevendo o próximo token.
- A aula é de jan/2023 e foi republicada no X em set/2026 com legenda errada sobre "agentes autoevolutivos".
Sumário · 15 seções
01Post original
- Link: post do X não registrado. O vídeo chegou como arquivo MP4 hospedado no X (upload por volta de 27/set/2026, 02:30, pelo identificador da mídia), sem o endereço do post. Uma busca na web em 04/out/2026 não encontrou o post.
- O que a legenda prometia: uma aula sobre redes de agentes autônomos e sistemas que se autoaprimoram. O conteúdo do vídeo é outro.
- Padrão conhecido: em ago/2026, várias contas republicaram aulas antigas de Karpathy como se fossem novas e com temas trocados; uma delas recebeu nota da comunidade. Uma análise independente mostrou que essas legendas apontavam justamente para esta aula do CS25 [5].
- Fonte usada no lugar do post: a publicação oficial da Stanford Online no YouTube [1].
02Contexto
Quem fala. Andrej Karpathy foi membro fundador da OpenAI e dirigiu a área de IA da Tesla; em 2024 fundou a Eureka Labs, de educação [5]. Na época da aula (jan/2023) estava trabalhando no nanoGPT, um código mínimo para treinar GPTs, que ele mostra durante a aula.
Onde nasceu o conteúdo. Aula introdutória do CS25 "Transformers United V2", curso-seminário de Stanford. A descrição oficial data a aula de 10/jan/2023; o vídeo foi publicado pela Stanford Online em 19/mai/2023 e tem 1h11min40s [1]. Os primeiros 10 minutos são dos instrutores do curso; Karpathy começa em 10:15 [1].
Por que circula agora. Contas de "dicas de IA" no X republicam aulas famosas com legendas de urgência ("ele condensou tudo o que sabe") para levar tráfego a outros conteúdos [5]. O clipe recebido tinha 1h08min30s, um pouco mais curto que o original.
03Afirmações × Realidade
A aula trata de construir redes de agentes autônomos e sistemas que se autoaprimoram (legenda)
O vídeo é a introdução aos Transformers do CS25; agentes aparecem só como desejo futuro na abertura dos instrutores [1].
"Attention Is All You Need" dispensou a recorrência e usou só atenção
O resumo do paper diz exatamente isso: arquitetura "baseada só em mecanismos de atenção, dispensando recorrência e convoluções" [2].
No GPT, uma máscara impede o token de olhar o futuro
O paper descreve o mascaramento no decoder para preservar a propriedade autorregressiva [2]; a explicação didática de Alammar mostra o mesmo [3].
Atenção custa caro em sequências longas
A tabela 1 do paper mostra complexidade O(n²·d) por camada de autoatenção [2].
Legenda: ✅ confirmado por fonte independente · ⚠️ parcial ou exagerado · ❌ contradito · ❓ sem fonte.
04Verificação
- Fonte primária: vídeo da Stanford Online, com título, data da aula, capítulos e duração [1].
- Independente 1: o paper original "Attention Is All You Need" (Vaswani et al., 2017), para checar Q/K/V, máscara, multi-head e complexidade [2].
- Independente 2: "The Illustrated Transformer", de Jay Alammar (2018), referência didática usada em cursos de várias universidades [3].
- Independente 3: análise da SparkOne (07/set/2026) sobre o padrão de republicação enganosa de aulas de Karpathy no X [5].
O que mudou desde jan/2023 (checado em 04/out/2026):
- O curso continua e mudou de foco. O CS25 está na sexta edição (V6, primavera de 2026), com palestras sobre alternativas ao Transformer, como modelos de espaço de estados (SSM), e sobre treino em milhares de GPUs [4].
- Contexto longo deixou de ser exceção. Na aula, os instrutores citam modelos limitados a cerca de 4.000 tokens [1]. Hoje o gargalo prático é mais custo e qualidade do que limite técnico, e a página de Alammar registra a evolução de detalhes como RoPE e Multi-Query Attention [3].
- Karpathy trocou o nanoGPT pelo nanochat, um projeto completo para treinar um chat pequeno, descrito como "o melhor ChatGPT que US$ 100 podem comprar" [6].
- A arquitetura central não mudou: atenção + MLP + resíduos + normalização seguem como base dos grandes modelos.
Limites. A transcrição de referência é a legenda automática da Stanford, com trechos inaudíveis. Os minutos citados são da versão Stanford, não do clipe do X.
05Mapa do conteúdo
- 00:00–10:15 · Abertura dos instrutores: linha do tempo da atenção e desafios (memória externa, custo quadrático, controle) [1].
- 10:15–19:00 · Karpathy: contexto histórico, de redes recorrentes a atenção na tradução automática.
- ~20:00 · "Apague tudo, fique com a atenção": o paper de 2017 e o bloco Transformer.
- ~22:00–30:00 · Atenção como fase de comunicação; Q, K e V; multi-head; MLP como fase de computação.
- ~31:00–43:00 · nanoGPT na prática: tokens, tamanho do bloco de contexto, treino em Shakespeare, geração.
- ~43:00–53:00 · Encoder, decoder e cross-attention: os três arranjos.
- ~53:00–60:00 · Transformers em imagens (patches) e aprendizado no prompt (in-context learning).
- 60:30–71:40 · Perguntas da plateia, incluindo a analogia do "computador de uso geral".
06Conceitos-chave
1. Da recorrência à atenção
- Em uma frase: em vez de comprimir a frase inteira num único vetor, o modelo passa a "olhar de volta" para as partes relevantes.
- Explicação: nas redes recorrentes (RNN), o codificador resumia a frase num estado que o decodificador recebia. Esse gargalo motivou a atenção. O paper de 2017 mostrou que dava para remover a recorrência e ficar só com a atenção, o que permite processar as posições em paralelo e treinar muito mais rápido [2].
- Exemplo da aula (~20:00): "delete everything, keep attention".
- Erro comum: achar que atenção nasceu com o Transformer. Ela já existia como peça auxiliar; a novidade foi torná-la o centro.
2. Q, K e V sem mistério
- Em uma frase: cada token faz uma pergunta (query), anuncia o que tem (key) e entrega um conteúdo (value).
- Explicação: a semelhança entre a query de um token e as keys dos outros gera notas; o softmax transforma as notas em pesos que somam 1; a saída é a soma ponderada dos values. O paper divide as notas por √d_k para estabilizar os gradientes [2]. Analogia: numa biblioteca, a query é o que você procura, as keys são as etiquetas das estantes e os values são os livros.
- Erro comum: confundir key com value. A key serve para decidir quanto olhar; o value é o que se recebe.
3. Comunicação e computação
- Em uma frase: a atenção é a fase em que os tokens conversam; o MLP é a fase em que cada um pensa sozinho.
- Explicação (~22:00): Karpathy descreve o Transformer como intercalando essas duas fases, bloco após bloco. Conexões residuais e normalização permitem empilhar muitos blocos sem que o treino desande [2].
- Erro comum: achar que mais cabeças e mais camadas são a mesma coisa. Cabeças trabalham em paralelo na mesma camada; camadas ficam em série.
4. Ordem e máscara causal
- Em uma frase: a atenção sozinha não sabe a ordem das palavras, e o GPT não pode espiar o futuro.
- Explicação: a posição entra como codificação somada aos embeddings [2][3]. No GPT, uma máscara zera a atenção para tokens futuros, porque o modelo é treinado para prever o próximo token.
5. Três arranjos
- Só encoder: todos os tokens se enxergam; o exemplo da aula é o BERT.
- Só decoder: prevê a continuação sem ver o futuro; o GPT é o exemplo central.
- Encoder–decoder: o decoder também consulta a saída do encoder por cross-attention, como no paper original de tradução [2]; exemplo citado: T5.
6. Como se treina um GPT
- Explicação (~31:00–43:00): o texto vira uma sequência de números (tokens). O modelo recebe um bloco de contexto e aprende a prever, em cada posição, o token seguinte; a perda (entropia cruzada) mede o erro. Na geração, o token previsto é acrescentado ao contexto e o processo se repete. Karpathy mostra isso no nanoGPT treinando com textos de Shakespeare.
7. Aprendizado no prompt
- Em uma frase: exemplos colocados no prompt mudam o comportamento do modelo sem mudar os pesos.
- Explicação (~55:00): é inferência, não treino. Karpathy usa a analogia de um computador de uso geral reprogramável por linguagem natural, mas é analogia, não garantia de execução fiel.
07Conexões
- Pré-requisitos: nenhum formal; ajuda saber o que é uma rede neural.
- Próximo passo na trilha: How I use LLMs, de Andrej Karpathy (fev/2025) usa o mesmo autor para ir da arquitetura ao uso diário (janela de contexto, tokens, ferramentas).
- Depois: Agentes de IA, segundo Andrew Ng: da ideia ao sistema mostra o que se constrói em cima do modelo: ferramentas, memória, avaliação e orquestração. A aula de hoje explica só o nível do modelo.
- Contrapontos: pesquisadores de modelos de espaço de estados (SSM) defendem alternativas mais baratas para sequências longas; o CS25 de 2026 dedica uma palestra a esse debate [4].
08Aplicações práticas
- Ao avaliar um "agente de IA", separe o modelo (previsão de tokens) da camada de ferramentas, memória e permissões.
- Em prompts, coloque exemplos relevantes e contexto claro: isso orienta a inferência, mas não ensina nada de forma permanente.
- Lembre que contexto longo custa processamento; buscar só o trecho relevante costuma ser mais barato e mais preciso do que colar tudo.
- Desconfie de legendas virais: confira título e data no canal oficial antes de assistir.
09Glossário
- Atenção Attention
- Mecanismo que dá pesos a outras posições da sequência para montar a representação de cada token.
- Bloco de contexto Block size / context length
- Número máximo de tokens que o modelo vê de uma vez.
- Conexão residual Residual connection
- Atalho que soma a entrada à saída de uma subcamada, facilitando treinar redes profundas.
- Cross-attention Cross-attention
- Atenção em que o decoder consulta a saída do encoder.
- Embedding Embedding
- Vetor numérico que representa um token.
- Entropia cruzada Cross-entropy loss
- Medida de erro entre a distribuição prevista e o token correto.
- In-context learning In-context learning
- Mudança de comportamento causada por exemplos no prompt, sem alterar pesos.
- Máscara causal Causal mask
- Bloqueio que impede um token de atender a posições futuras.
- Multi-head Multi-head attention
- Várias atenções em paralelo, cada uma com projeções próprias.
- Query, key, value Q, K, V
- Projeções de cada token usadas para calcular e entregar a atenção.
- Softmax Softmax
- Função que transforma notas em probabilidades positivas que somam 1.
- Token Token
- Pedaço de texto (palavra ou parte) convertido em número.
10Quiz
O que o paper de 2017 removeu em relação aos modelos anteriores?
- a) A atenção
- b) A recorrência e as convoluções
- c) Os embeddings
- d) O softmax
Ver resposta ›
b) A arquitetura passou a se basear só em atenção [2].
Para que serve a key (K)?
- a) Guardar o conteúdo que será entregue
- b) Ser comparada com a query para decidir quanto atender
- c) Indicar a posição do token
- d) Calcular a perda
Ver resposta ›
b) O conteúdo entregue é o value; a key decide o peso.
Por que o GPT usa máscara causal?
- a) Para economizar memória
- b) Porque é treinado para prever o próximo token e não pode ver o futuro
- c) Para traduzir textos
- d) Para ler imagens
Ver resposta ›
b) Sem a máscara, o modelo "colaria" a resposta durante o treino [2].
Qual a diferença entre várias cabeças e várias camadas?
- a) Nenhuma
- b) Cabeças trabalham em paralelo na mesma camada; camadas ficam em série
- c) Camadas são só para imagens
- d) Cabeças só existem no encoder
Ver resposta ›
b) Multi-head é paralelismo dentro da camada; profundidade é empilhamento.
Exemplos no prompt mudam os pesos do modelo?
Ver resposta ›
não. É in-context learning: muda o comportamento naquela inferência, sem treino. Ao abrir uma conversa nova, o efeito some.
Por que a legenda do X que acompanhou o vídeo estava errada?
11Flashcards
Toque no cartão para virar. Baixar CSV para o Anki › (separador “;”, colunas frente;verso;tags)
12Exercício aplicado
Tarefa (25 min): escolha a frase "O gato subiu no telhado porque ele estava com medo". Desenhe à mão os tokens e, para o token "ele", escreva qual seria a query (o que ele procura), quais keys combinariam mais e qual value seria entregue. Depois, marque com X as setas que a máscara causal proibiria se o modelo estivesse gerando a frase da esquerda para a direita.
Feito quando: o desenho mostra pelo menos 3 setas com peso alto/baixo justificado e todas as setas para tokens futuros estão marcadas como proibidas.
13Leituras
- The Illustrated Transformer · artigo ilustrado · iniciante · a melhor ponte entre esta aula e o paper [3].
- Attention Is All You Need · paper · avançado · seções 3.1 a 3.5 cobrem tudo o que a aula explica [2].
- Stanford CS25 · curso · intermediário · palestras de 2026 sobre alternativas e escala [4].
- nanochat · código · avançado · o sucessor do nanoGPT, para quem quer treinar um modelo pequeno [6].
14Fontes
- Stanford Online. Stanford CS25: V2 I Introduction to Transformers w/ Andrej Karpathy. YouTube, aula de 10/jan/2023, publicada em 19/mai/2023, 1h11min40s. https://www.youtube.com/watch?v=XfpMkf4rD6E · fonte primária · acessado em 04/out/2026.
- Vaswani, A. et al. Attention Is All You Need. arXiv:1706.03762, 2017. https://arxiv.org/abs/1706.03762 · independente · acessado em 04/out/2026.
- Alammar, J. The Illustrated Transformer, 27/jun/2018 (com atualizações). https://jalammar.github.io/illustrated-transformer/ · independente · acessado em 04/out/2026.
- Stanford University. CS25: Transformers United V6 (programa de 2026). https://web.stanford.edu/class/cs25/ · acessado em 04/out/2026.
- Vonk, J. The thread said last week. The lecture is eighteen months old. SparkOne, 07/set/2026. https://sparkone.nl/en/blog/karpathy-lecture-sold-as-news/ · independente · acessado em 04/out/2026.
- Karpathy, A. nanochat (repositório). GitHub. https://github.com/karpathy/nanochat · acessado em 04/out/2026.
15Ficha técnica
- Post original: não registrado (só o MP4 do X) · Mídia oficial: Stanford Online no YouTube
- Preparado em: 04/out/2026 pelo agente 📚 Estudos, a partir de um resumo anterior de 27/set/2026 e da legenda oficial da Stanford.
- Última verificação das fontes: 04/out/2026.
- Método: clipe do X (1h08min30s) comparado com a publicação da Stanford; conceitos checados no paper original; transcrição em inglês não reproduzida aqui (consulte a legenda no YouTube).
- Limites conhecidos: legenda automática com trechos inaudíveis; minutos aproximados.
- Validade: conceitos estáveis; a parte "o que mudou" deve ser revista a cada 12 meses.