EstudosTodos os materiais ›
Estudos›inteligência artificial

Transformers, por Andrej Karpathy (Stanford CS25, 2023)

Aula em vídeo · 1h11 · Andrej Karpathy · original de 10/jan/2023 · Nível: intermediário · ⏱ 14 min de leitura

Preparado em 04/out/2026 · 6 fontes · Post do X não registrado

TL;DR
  • O Transformer alterna duas fases: os tokens trocam informação por atenção e depois cada um processa sozinho o que recebeu.
  • Karpathy resume o paper de 2017 como "apague tudo, fique com a atenção" e mostra como treinar um GPT pequeno prevendo o próximo token.
  • A aula é de jan/2023 e foi republicada no X em set/2026 com legenda errada sobre "agentes autoevolutivos".
Sumário · 15 seções
  1. Post original
  2. Contexto
  3. Afirmações × Realidade
  4. Verificação
  5. Mapa do conteúdo
  6. Conceitos-chave
  7. Conexões
  8. Aplicações práticas
  9. Glossário
  10. Quiz
  11. Flashcards
  12. Exercício aplicado
  13. Leituras
  14. Fontes
  15. Ficha técnica

01Post original

  • Link: post do X não registrado. O vídeo chegou como arquivo MP4 hospedado no X (upload por volta de 27/set/2026, 02:30, pelo identificador da mídia), sem o endereço do post. Uma busca na web em 04/out/2026 não encontrou o post.
  • O que a legenda prometia: uma aula sobre redes de agentes autônomos e sistemas que se autoaprimoram. O conteúdo do vídeo é outro.
  • Padrão conhecido: em ago/2026, várias contas republicaram aulas antigas de Karpathy como se fossem novas e com temas trocados; uma delas recebeu nota da comunidade. Uma análise independente mostrou que essas legendas apontavam justamente para esta aula do CS25 [5].
  • Fonte usada no lugar do post: a publicação oficial da Stanford Online no YouTube [1].

02Contexto

Quem fala. Andrej Karpathy foi membro fundador da OpenAI e dirigiu a área de IA da Tesla; em 2024 fundou a Eureka Labs, de educação [5]. Na época da aula (jan/2023) estava trabalhando no nanoGPT, um código mínimo para treinar GPTs, que ele mostra durante a aula.

Onde nasceu o conteúdo. Aula introdutória do CS25 "Transformers United V2", curso-seminário de Stanford. A descrição oficial data a aula de 10/jan/2023; o vídeo foi publicado pela Stanford Online em 19/mai/2023 e tem 1h11min40s [1]. Os primeiros 10 minutos são dos instrutores do curso; Karpathy começa em 10:15 [1].

Por que circula agora. Contas de "dicas de IA" no X republicam aulas famosas com legendas de urgência ("ele condensou tudo o que sabe") para levar tráfego a outros conteúdos [5]. O clipe recebido tinha 1h08min30s, um pouco mais curto que o original.

03Afirmações × Realidade

❌ Contradito#1

A aula trata de construir redes de agentes autônomos e sistemas que se autoaprimoram (legenda)

O vídeo é a introdução aos Transformers do CS25; agentes aparecem só como desejo futuro na abertura dos instrutores [1].

❌ Contradito#2

É uma aula recente

Aula de 10/jan/2023, publicada em 19/mai/2023 [1].

✅ Confirmado#3

"Attention Is All You Need" dispensou a recorrência e usou só atenção

O resumo do paper diz exatamente isso: arquitetura "baseada só em mecanismos de atenção, dispensando recorrência e convoluções" [2].

✅ Confirmado#4

No GPT, uma máscara impede o token de olhar o futuro

O paper descreve o mascaramento no decoder para preservar a propriedade autorregressiva [2]; a explicação didática de Alammar mostra o mesmo [3].

✅ Confirmado#5

Atenção custa caro em sequências longas

A tabela 1 do paper mostra complexidade O(n²·d) por camada de autoatenção [2].

Legenda: ✅ confirmado por fonte independente · ⚠️ parcial ou exagerado · ❌ contradito · ❓ sem fonte.

04Verificação

  • Fonte primária: vídeo da Stanford Online, com título, data da aula, capítulos e duração [1].
  • Independente 1: o paper original "Attention Is All You Need" (Vaswani et al., 2017), para checar Q/K/V, máscara, multi-head e complexidade [2].
  • Independente 2: "The Illustrated Transformer", de Jay Alammar (2018), referência didática usada em cursos de várias universidades [3].
  • Independente 3: análise da SparkOne (07/set/2026) sobre o padrão de republicação enganosa de aulas de Karpathy no X [5].

O que mudou desde jan/2023 (checado em 04/out/2026):

  • O curso continua e mudou de foco. O CS25 está na sexta edição (V6, primavera de 2026), com palestras sobre alternativas ao Transformer, como modelos de espaço de estados (SSM), e sobre treino em milhares de GPUs [4].
  • Contexto longo deixou de ser exceção. Na aula, os instrutores citam modelos limitados a cerca de 4.000 tokens [1]. Hoje o gargalo prático é mais custo e qualidade do que limite técnico, e a página de Alammar registra a evolução de detalhes como RoPE e Multi-Query Attention [3].
  • Karpathy trocou o nanoGPT pelo nanochat, um projeto completo para treinar um chat pequeno, descrito como "o melhor ChatGPT que US$ 100 podem comprar" [6].
  • A arquitetura central não mudou: atenção + MLP + resíduos + normalização seguem como base dos grandes modelos.

Limites. A transcrição de referência é a legenda automática da Stanford, com trechos inaudíveis. Os minutos citados são da versão Stanford, não do clipe do X.

05Mapa do conteúdo

  1. 00:00–10:15 · Abertura dos instrutores: linha do tempo da atenção e desafios (memória externa, custo quadrático, controle) [1].
  2. 10:15–19:00 · Karpathy: contexto histórico, de redes recorrentes a atenção na tradução automática.
  3. ~20:00 · "Apague tudo, fique com a atenção": o paper de 2017 e o bloco Transformer.
  4. ~22:00–30:00 · Atenção como fase de comunicação; Q, K e V; multi-head; MLP como fase de computação.
  5. ~31:00–43:00 · nanoGPT na prática: tokens, tamanho do bloco de contexto, treino em Shakespeare, geração.
  6. ~43:00–53:00 · Encoder, decoder e cross-attention: os três arranjos.
  7. ~53:00–60:00 · Transformers em imagens (patches) e aprendizado no prompt (in-context learning).
  8. 60:30–71:40 · Perguntas da plateia, incluindo a analogia do "computador de uso geral".

06Conceitos-chave

1. Da recorrência à atenção

  • Em uma frase: em vez de comprimir a frase inteira num único vetor, o modelo passa a "olhar de volta" para as partes relevantes.
  • Explicação: nas redes recorrentes (RNN), o codificador resumia a frase num estado que o decodificador recebia. Esse gargalo motivou a atenção. O paper de 2017 mostrou que dava para remover a recorrência e ficar só com a atenção, o que permite processar as posições em paralelo e treinar muito mais rápido [2].
  • Exemplo da aula (~20:00): "delete everything, keep attention".
  • Erro comum: achar que atenção nasceu com o Transformer. Ela já existia como peça auxiliar; a novidade foi torná-la o centro.

2. Q, K e V sem mistério

  • Em uma frase: cada token faz uma pergunta (query), anuncia o que tem (key) e entrega um conteúdo (value).
  • Explicação: a semelhança entre a query de um token e as keys dos outros gera notas; o softmax transforma as notas em pesos que somam 1; a saída é a soma ponderada dos values. O paper divide as notas por √d_k para estabilizar os gradientes [2]. Analogia: numa biblioteca, a query é o que você procura, as keys são as etiquetas das estantes e os values são os livros.
  • Erro comum: confundir key com value. A key serve para decidir quanto olhar; o value é o que se recebe.
Query (Q)o que procuro Keys (K)o que cada um tem Values (V)o conteúdo Q · K / √dnotas de afinidade Softmaxpesos somam 1 SaídaΣ peso × value
Uma cabeça de atenção. O multi-head repete isso em paralelo com projeções diferentes [2].

3. Comunicação e computação

  • Em uma frase: a atenção é a fase em que os tokens conversam; o MLP é a fase em que cada um pensa sozinho.
  • Explicação (~22:00): Karpathy descreve o Transformer como intercalando essas duas fases, bloco após bloco. Conexões residuais e normalização permitem empilhar muitos blocos sem que o treino desande [2].
  • Erro comum: achar que mais cabeças e mais camadas são a mesma coisa. Cabeças trabalham em paralelo na mesma camada; camadas ficam em série.

4. Ordem e máscara causal

  • Em uma frase: a atenção sozinha não sabe a ordem das palavras, e o GPT não pode espiar o futuro.
  • Explicação: a posição entra como codificação somada aos embeddings [2][3]. No GPT, uma máscara zera a atenção para tokens futuros, porque o modelo é treinado para prever o próximo token.

5. Três arranjos

  • Só encoder: todos os tokens se enxergam; o exemplo da aula é o BERT.
  • Só decoder: prevê a continuação sem ver o futuro; o GPT é o exemplo central.
  • Encoder–decoder: o decoder também consulta a saída do encoder por cross-attention, como no paper original de tradução [2]; exemplo citado: T5.

6. Como se treina um GPT

  • Explicação (~31:00–43:00): o texto vira uma sequência de números (tokens). O modelo recebe um bloco de contexto e aprende a prever, em cada posição, o token seguinte; a perda (entropia cruzada) mede o erro. Na geração, o token previsto é acrescentado ao contexto e o processo se repete. Karpathy mostra isso no nanoGPT treinando com textos de Shakespeare.

7. Aprendizado no prompt

  • Em uma frase: exemplos colocados no prompt mudam o comportamento do modelo sem mudar os pesos.
  • Explicação (~55:00): é inferência, não treino. Karpathy usa a analogia de um computador de uso geral reprogramável por linguagem natural, mas é analogia, não garantia de execução fiel.

07Conexões

  • Pré-requisitos: nenhum formal; ajuda saber o que é uma rede neural.
  • Próximo passo na trilha: How I use LLMs, de Andrej Karpathy (fev/2025) usa o mesmo autor para ir da arquitetura ao uso diário (janela de contexto, tokens, ferramentas).
  • Depois: Agentes de IA, segundo Andrew Ng: da ideia ao sistema mostra o que se constrói em cima do modelo: ferramentas, memória, avaliação e orquestração. A aula de hoje explica só o nível do modelo.
  • Contrapontos: pesquisadores de modelos de espaço de estados (SSM) defendem alternativas mais baratas para sequências longas; o CS25 de 2026 dedica uma palestra a esse debate [4].

08Aplicações práticas

  • Ao avaliar um "agente de IA", separe o modelo (previsão de tokens) da camada de ferramentas, memória e permissões.
  • Em prompts, coloque exemplos relevantes e contexto claro: isso orienta a inferência, mas não ensina nada de forma permanente.
  • Lembre que contexto longo custa processamento; buscar só o trecho relevante costuma ser mais barato e mais preciso do que colar tudo.
  • Desconfie de legendas virais: confira título e data no canal oficial antes de assistir.

09Glossário

Atenção Attention
Mecanismo que dá pesos a outras posições da sequência para montar a representação de cada token.
Bloco de contexto Block size / context length
Número máximo de tokens que o modelo vê de uma vez.
Conexão residual Residual connection
Atalho que soma a entrada à saída de uma subcamada, facilitando treinar redes profundas.
Cross-attention Cross-attention
Atenção em que o decoder consulta a saída do encoder.
Embedding Embedding
Vetor numérico que representa um token.
Entropia cruzada Cross-entropy loss
Medida de erro entre a distribuição prevista e o token correto.
In-context learning In-context learning
Mudança de comportamento causada por exemplos no prompt, sem alterar pesos.
Máscara causal Causal mask
Bloqueio que impede um token de atender a posições futuras.
Multi-head Multi-head attention
Várias atenções em paralelo, cada uma com projeções próprias.
Query, key, value Q, K, V
Projeções de cada token usadas para calcular e entregar a atenção.
Softmax Softmax
Função que transforma notas em probabilidades positivas que somam 1.
Token Token
Pedaço de texto (palavra ou parte) convertido em número.

10Quiz

  1. O que o paper de 2017 removeu em relação aos modelos anteriores?

    • a) A atenção
    • b) A recorrência e as convoluções
    • c) Os embeddings
    • d) O softmax
    Ver resposta ›

    b) A arquitetura passou a se basear só em atenção [2].

  2. Para que serve a key (K)?

    • a) Guardar o conteúdo que será entregue
    • b) Ser comparada com a query para decidir quanto atender
    • c) Indicar a posição do token
    • d) Calcular a perda
    Ver resposta ›

    b) O conteúdo entregue é o value; a key decide o peso.

  3. Por que o GPT usa máscara causal?

    • a) Para economizar memória
    • b) Porque é treinado para prever o próximo token e não pode ver o futuro
    • c) Para traduzir textos
    • d) Para ler imagens
    Ver resposta ›

    b) Sem a máscara, o modelo "colaria" a resposta durante o treino [2].

  4. Qual a diferença entre várias cabeças e várias camadas?

    • a) Nenhuma
    • b) Cabeças trabalham em paralelo na mesma camada; camadas ficam em série
    • c) Camadas são só para imagens
    • d) Cabeças só existem no encoder
    Ver resposta ›

    b) Multi-head é paralelismo dentro da camada; profundidade é empilhamento.

  5. Exemplos no prompt mudam os pesos do modelo?

    Ver resposta ›

    não. É in-context learning: muda o comportamento naquela inferência, sem treino. Ao abrir uma conversa nova, o efeito some.

  6. Por que a legenda do X que acompanhou o vídeo estava errada?

    Ver resposta ›

    anunciava agentes autônomos e sistemas que se autoaprimoram, mas o vídeo é a aula introdutória sobre Transformers de jan/2023 [1][5].

11Flashcards

Toque no cartão para virar. Baixar CSV para o Anki › (separador “;”, colunas frente;verso;tags)

12Exercício aplicado

Tarefa (25 min): escolha a frase "O gato subiu no telhado porque ele estava com medo". Desenhe à mão os tokens e, para o token "ele", escreva qual seria a query (o que ele procura), quais keys combinariam mais e qual value seria entregue. Depois, marque com X as setas que a máscara causal proibiria se o modelo estivesse gerando a frase da esquerda para a direita.

Feito quando: o desenho mostra pelo menos 3 setas com peso alto/baixo justificado e todas as setas para tokens futuros estão marcadas como proibidas.

13Leituras

14Fontes

  1. Stanford Online. Stanford CS25: V2 I Introduction to Transformers w/ Andrej Karpathy. YouTube, aula de 10/jan/2023, publicada em 19/mai/2023, 1h11min40s. https://www.youtube.com/watch?v=XfpMkf4rD6E · fonte primária · acessado em 04/out/2026.
  2. Vaswani, A. et al. Attention Is All You Need. arXiv:1706.03762, 2017. https://arxiv.org/abs/1706.03762 · independente · acessado em 04/out/2026.
  3. Alammar, J. The Illustrated Transformer, 27/jun/2018 (com atualizações). https://jalammar.github.io/illustrated-transformer/ · independente · acessado em 04/out/2026.
  4. Stanford University. CS25: Transformers United V6 (programa de 2026). https://web.stanford.edu/class/cs25/ · acessado em 04/out/2026.
  5. Vonk, J. The thread said last week. The lecture is eighteen months old. SparkOne, 07/set/2026. https://sparkone.nl/en/blog/karpathy-lecture-sold-as-news/ · independente · acessado em 04/out/2026.
  6. Karpathy, A. nanochat (repositório). GitHub. https://github.com/karpathy/nanochat · acessado em 04/out/2026.

15Ficha técnica

  • Post original: não registrado (só o MP4 do X) · Mídia oficial: Stanford Online no YouTube
  • Preparado em: 04/out/2026 pelo agente 📚 Estudos, a partir de um resumo anterior de 27/set/2026 e da legenda oficial da Stanford.
  • Última verificação das fontes: 04/out/2026.
  • Método: clipe do X (1h08min30s) comparado com a publicação da Stanford; conceitos checados no paper original; transcrição em inglês não reproduzida aqui (consulte a legenda no YouTube).
  • Limites conhecidos: legenda automática com trechos inaudíveis; minutos aproximados.
  • Validade: conceitos estáveis; a parte "o que mudou" deve ser revista a cada 12 meses.