Andrej Karpathy y el famoso vídeo “Construyamos GPT”
Si está aprendiendo IA, especialmente modelos de lenguaje grandes, el vídeo de Andrej Karpathy “Construyamos GPT: desde cero, en código, explicado” es uno de los recursos más valiosos que no debe perderse.
Este es uno de los vídeos más populares del canal de YouTube de Karpathy, con más de 7 millones de visitas. El video dura casi dos horas, pero en lugar de brindar solo una explicación de alto nivel, Karpathy guía a los espectadores a través del proceso de construcción de un pequeño modelo GPT desde cero, paso a paso, directamente en código.
What makes this video special is that it does not simply answer the question: “What is GPT?”
More importantly, it helps learners understand: “How is GPT actually built?”
Por qué vale la pena ver este vídeo para los estudiantes de IA
In the current AI boom, many people comenzar by using tools like ChatGPT, Claude, Gemini, or other generative AI platforms. However, if you only use AI tools without understanding what happens behind the scenes, it is difficult to truly understand how large language models work.
El tutorial de Karpathy es especialmente útil para los estudiantes que prefieren un enfoque más técnico y "duro": leer código, comprender la arquitectura y ver cómo fluyen los datos a través de cada capa del modelo.
En lugar de tratar a GPT como una caja negra, el vídeo guía a los alumnos a través de conceptos importantes como:
- Cómo un modelo de lenguaje predice el siguiente token.
- Cómo se procesan los datos de texto antes de pasarlos al modelo.
- Cómo funciona la autoatención.
- Cómo la arquitectura Transformer se convierte en la base de GPT.
- Cómo un modelo pequeño puede aprender de los datos y generar texto.
Es por eso que el video a menudo se considera una introducción avanzada para cualquiera que quiera comprender los LLM a un nivel técnico más profundo.
¿Quién es Andrej Karpathy?
Andrej Karpathy es una de las figuras más influyentes de la inteligencia artificial moderna. Fue miembro fundador de OpenAI y luego se desempeñó como Director de IA en Tesla, donde trabajó profundamente en visión por computadora y sistemas de piloto automático.
Karpathy también es conocido por su trabajo educativo, incluidas sus contribuciones al famoso curso de aprendizaje profundo CS231n de Stanford. Más recientemente, ha seguido atrayendo la atención en la comunidad de IA después de unirse a Anthropic, la empresa detrás de la familia Claude de modelos de IA.
Debido a estos antecedentes, su contenido educativo sobre IA es muy respetado. Proviene de alguien que tiene sólidas bases de investigación y experiencia en el mundo real en algunas de las principales organizaciones de IA del mundo.
¿Qué enseña el vídeo “Construyamos GPT desde cero”?
El objetivo principal del vídeo es construir un pequeño modelo estilo GPT desde cero. Los alumnos son guiados a través del proceso de creación de un modelo de lenguaje, comenzando con conceptos simples y avanzando gradualmente hacia la arquitectura Transformer.
Algunas de las partes más importantes del video incluyen:
1. Comprender los modelos lingüísticos a un nivel básico
Karpathy comienza explicando cómo un modelo de lenguaje aprende de datos de texto. En esencia, GPT está capacitado para predecir el siguiente token en función del contexto anterior.
Esta idea puede parecer simple, pero es la base de muchos sistemas de IA generativa modernos. Cuando se entrena con grandes cantidades de datos con una arquitectura poderosa, un modelo de lenguaje puede generar texto natural, responder preguntas, escribir código, resumir contenido y realizar muchas otras tareas de lenguaje complejas.
2. Construyendo el modelo paso a paso en código.
La parte más valiosa del vídeo es que Karpathy no sólo explica GPT en teoría. Escribe el código directamente, lo que permite a los alumnos ver cómo se construye cada parte del modelo.
A partir de un modelo simple, el tutorial se expande gradualmente hacia componentes más avanzados. Esto hace que el proceso de aprendizaje sea más fácil de seguir porque los espectadores no están obligados a comprender toda la arquitectura de Transformer de una sola vez.
3. Explicando la autoatención y la arquitectura Transformer.
La autoatención es uno de los conceptos más importantes para comprender GPT. Permite que el modelo decida qué partes del contexto de entrada son más relevantes al predecir el siguiente token.
En el vídeo, Karpathy explica la atención personal conectándola directamente con el código y los datos. Esto hace que el concepto sea más fácil de entender en comparación con aprenderlo únicamente mediante fórmulas matemáticas.
Después de eso, componentes como la atención de múltiples cabezales, las capas de retroalimentación, las conexiones residuales y la normalización de capas se combinan para formar la arquitectura Transformer.
4. Conexión del tutorial a GPT, ChatGPT y LLM modernos
Aunque el modelo creado en el video es mucho más pequeño que sistemas como ChatGPT, aún ayuda a los estudiantes a comprender los principios básicos detrás de los modelos de estilo GPT.
In other words, this video will not immediately teach you how to build ChatGPT at production scale. However, it gives you the mental framework needed to understand how large language models work: data, tokens, probabilities, attention, Transformers, training, and texto generation.
¿Quién debería ver este vídeo?
Este vídeo es especialmente adecuado para:
- Personas que ya conocen Python básico y quieren aprender IA más profundamente.
- Estudiantes de informática, ciencia de datos o aprendizaje automático.
- Desarrolladores que quieran comprender los LLM en lugar de solo llamar a las API.
- Estudiantes que estudian Transformers, GPT, ChatGPT o modelos de lenguaje grandes.
- Cualquiera que quiera codificar un pequeño modelo de IA para comprender cómo funciona internamente.
However, this video may not be ideal for complete beginners who have no programming background or no basic understanding of Python, tensors, neural networks, and machine learning. If you are just starting out, it is better to first learn Python, neural networks, gradient descent, and PyTorch before going through this tutorial.
Por qué este vídeo sigue siendo importante en una industria de la IA en rápido movimiento
The AI field changes very quickly. New models appear, new tools are released, and APIs are updated constantly. However, fundamental concepts such as language modeling, self-attention, and Transformer architecture remain extremely important.
Por eso el vídeo de Karpathy sigue teniendo valor a largo plazo. No se limita a enseñar a los alumnos cómo gestionar una biblioteca existente. Les ayuda a comprender la estructura interna de un modelo GPT.
Una vez que comprenda esta base, será mucho más fácil aprender temas más avanzados, como el ajuste fino, RLHF, optimización de inferencia, RAG, IA agente y preentrenamiento de modelos.
¿Deberías aprender GPT desde cero?
Sí, si tu objetivo es comprender la IA a nivel técnico.
Today, many people can use ChatGPT or call an API to build AI-powered applications. But if you want to go further — for example, to research LLMs, optimize models, build serious AI products, or understand how AI systems actually work — then learning GPT from scratch is a worthwhile step.
El vídeo de Andrej Karpathy es uno de los mejores recursos para este camino de aprendizaje porque combina teoría, código e intuición técnica de forma práctica.
Conclusion
“Construyamos GPT: desde cero, en código, detallado” es más que un simple tutorial de programación de IA. Es una lección fundamental que ayuda a los alumnos a comprender cómo se puede construir un modelo GPT a partir de los componentes más básicos.
Para cualquiera que esté aprendiendo IA, LLM o la tecnología detrás de ChatGPT, vale la pena ver este video. No te convertirá en un experto en IA en dos horas, pero te ayudará a ver GPT de otra manera: no como magia, sino como un sistema con arquitectura, lógica y código que se puede construir paso a paso.
Video enlace:
Let’s build GPT: from scratch, in code, spelled out. — YouTube


