← Volver al blog

· Thiago Perez

¿Cómo se entrena una inteligencia artificial?

Mucha gente se imagina que ChatGPT tiene guardadas todas las respuestas, como una enciclopedia gigante en la que busca y copia.

No funciona así. Una IA no guarda respuestas: aprende patrones a partir de muchísimos ejemplos. Y para entender cómo, alcanza con perros, gatos y libros.

Primero, perros y gatos

Imaginate que querés que una computadora distinga un perro de un gato. No le escribís una regla para cada caso. Le mostrás miles de fotos, y cada una viene con su respuesta: “perro” o “gato”.

Al principio adivina cualquier cosa. Cada vez que se equivoca, se corrige un poquito. Foto tras foto, empieza a notar lo que se repite: la forma del hocico, las orejas, el tamaño, los bigotes.

Google lo explica así en su curso de aprendizaje automático: el modelo mira un ejemplo, hace una predicción, la compara con la respuesta correcta y ajusta su solución según cuánto se equivocó. Repite eso con cada ejemplo, a veces varias veces.

Lo interesante viene después: le mostrás un perro que nunca vio y lo reconoce. No porque tenga esa foto guardada, sino porque aprendió cómo suele ser un perro. Por eso importan la cantidad y la variedad de ejemplos. Google aclara que los buenos conjuntos de datos son grandes y diversos: si solo vio perros negros, uno blanco lo puede confundir.

Esto tiene nombre: aprendizaje automático, una de las capas de la inteligencia artificial que repasamos en qué es la inteligencia artificial.

Después, libros

Con un modelo de lenguaje, como el que usa ChatGPT, la idea es la misma. Pero en vez de fotos, lee texto: páginas web, libros, artículos. Muchísimo texto.

Acá no hace falta que alguien le ponga la respuesta a cada ejemplo, porque el propio texto es el ejercicio: se tapa la palabra que sigue y el modelo tiene que adivinarla. OpenAI da este ejemplo: “En vez de doblar a la izquierda, dobló a la ___”.

Al principio responde casi al azar. Después de millones de frases, acierta cada vez más. Así aprende cómo se combinan las palabras, cómo se arma una respuesta y muchas cosas que aparecen una y otra vez en lo que leyó. Es el mismo mecanismo de predicción que contamos en qué es un LLM, y lo que lee, lo lee en pedacitos llamados tokens.

¿Entonces guarda los libros?

Según OpenAI, no. Un modelo es, en el fondo, un conjunto enorme de números (los “parámetros”). Al entrenar, esos números se ajustan de a poco para reflejar los patrones que encuentra, y no se guardan copias de lo que leyó. OpenAI lo compara con un docente que, después de estudiar mucho, puede explicar un tema sin recitar los libros de memoria.

Igual no es perfecto: la misma OpenAI reconoce el riesgo de que un modelo repita partes de lo que vio, y por eso elimina contenido duplicado al entrenar.

Las dos grandes etapas

Lo que vimos hasta acá es la primera etapa, el preentrenamiento: el modelo lee una cantidad enorme de texto y aprende el idioma. Con eso solo, sabe continuar textos, pero todavía no es un buen asistente.

Después viene el post-entrenamiento, un ajuste en el que intervienen personas:

  • Escriben ejemplos de buenas respuestas a distintas preguntas.
  • Comparan respuestas del modelo y marcan cuál es mejor.
  • Con esas preferencias, el modelo se sigue ajustando. A esta técnica se la conoce como RLHF: aprendizaje por refuerzo a partir de la retroalimentación humana.

OpenAI lo mostró en enero de 2022 con sus modelos InstructGPT: después de este ajuste seguían mejor las instrucciones e inventaban datos con menos frecuencia. Anthropic describe el mismo recorrido para Claude: primero un preentrenamiento con grandes conjuntos de datos y después un post-entrenamiento importante para que sea un asistente útil.

¿De dónde salen tantos datos?

Esta es la pregunta del millón. OpenAI dice que sus modelos se entrenan con tres fuentes principales:

  • Información pública en internet: páginas, foros, blogs. Aclara que no busca a propósito contenido detrás de un muro de pago y que filtra spam, contenido para adultos y sitios que juntan datos personales.
  • Información a la que accede por acuerdos con terceros.
  • Información que aportan usuarios, entrenadores humanos e investigadores.

A eso suma cada vez más datos sintéticos, es decir, ejemplos generados por otros modelos. Anthropic describe una mezcla parecida en su centro de transparencia: información pública de internet, conjuntos de datos públicos y privados, datos sintéticos y, según el modelo, datos de usuarios.

Pero no siempre fue todo tan prolijo. Y acá aparece el caso real de Anthropic.

El caso real de Anthropic

En agosto de 2024, tres escritores (Andrea Bartz, Charles Graeber y Kirk Wallace Johnson) demandaron a Anthropic, la empresa detrás de Claude, en un tribunal federal de California, en Estados Unidos. La acusaban de usar sus libros para entrenar a su IA sin permiso.

El 23 de junio de 2025, el juez William Alsup dictó un fallo con dos partes muy distintas. Según el fallo, Anthropic había descargado gratis más de siete millones de copias pirateadas de libros. También había comprado millones de libros en papel, les había sacado la encuadernación y los había escaneado. El juez separó tres cosas:

  • Entrenar con libros: lo consideró “fair use” (uso legítimo, una figura de la ley de derechos de autor de Estados Unidos). Lo comparó con un lector que quiere ser escritor: aprende de las obras no para copiarlas, sino para crear algo distinto.
  • Escanear los libros que había comprado: también uso legítimo, porque solo reemplazó el papel por una copia digital para su biblioteca interna.
  • Guardar las copias pirateadas en esa biblioteca: eso no. Esa parte iba a ir a juicio.

No llegó a juicio. El 5 de septiembre de 2025, Anthropic acordó pagar US$ 1.500 millones para cerrar la demanda colectiva: unos US$ 3.000 por libro, para casi medio millón de obras. También se comprometió a destruir los archivos descargados de dos de esos sitios (LibGen y PiLiMi), y declaró que esos archivos no formaron parte del entrenamiento de ningún modelo que haya lanzado comercialmente. La jueza Araceli Martínez-Olguín le dio la aprobación final el 20 de julio de 2026.

¿La lección? En este caso, el problema no fue cómo aprende la IA, sino de dónde salieron los libros. Y el debate no está cerrado: es un fallo de primera instancia de otro país, el acuerdo no cubre reclamos por lo que los modelos generan y hay otras demandas en curso contra empresas de IA.

Qué significa esto para tu pyme

Primero, una tranquilidad: no necesitás entrenar una IA desde cero. Eso lo hacen las empresas que crean los modelos. OpenAI, por ejemplo, aclara que sus modelos ya vienen preentrenados para una gran variedad de temas y tareas, y que muchas veces alcanza con escribir buenas instrucciones.

Lo habitual es usar un modelo existente y darle la información de tu negocio: precios, horarios, políticas. Es como sumar a alguien que ya sabe leer y escribir, y explicarle cómo trabaja tu empresa. Así se arma un agente de IA que responde por WhatsApp con tus datos, no con lo que “cree” saber.

Segundo, conviene preguntar qué pasa con los datos de tus clientes. Cada empresa de IA explica en sus políticas si usa las conversaciones para entrenar. OpenAI, por ejemplo, permite desactivar que tus chats de ChatGPT se usen para mejorar sus modelos. Si vas a conectar una IA a tu WhatsApp, revisalo antes, igual que mirás cuánto te va a costar.

FAQ

Preguntas frecuentes

Lo que más se pregunta cuando alguien empieza a entender cómo aprende una IA.

Si todavía no sabés por dónde empezar, tenés este diagnóstico breve.

Y si querés ver cómo un modelo ya entrenado puede atender las consultas de tu negocio con tu propia información, podés conocer cómo trabajamos los agentes de IA o agendar una llamada para revisar tu caso.

Fuentes