¿Qué es el Proyecto Panama de Anthropic? Así es cómo millones de libros son destruidos para alimentar a la inteligencia artificial

¿Qué es el Proyecto Panama de Anthropic? Así es cómo millones de libros son destruidos para alimentar a la inteligencia artificial

Los libros son el mayor depósito de conocimiento en la historia de la humanidad. Cada volumen representa años de investigación, creatividad y experiencia acumulada. Desde tratados científicos hasta novelas clásicas, la literatura ha servido como el principal vehículo para transmitir ideas entre generaciones, culturas y civilizaciones enteras.

Paradójicamente, esa misma biblioteca universal se ha convertido en uno de los recursos más codiciados (y polémicos) por las empresas que lideran la revolución de la inteligencia artificial.

Mientras millones de personas conversan diariamente con asistentes como Claude, ChatGPT o Gemini, pocos imaginan el enorme esfuerzo (y los dilemas éticos) que existen detrás del entrenamiento de estos modelos. Para que una IA sea capaz de responder preguntas, escribir código, traducir idiomas o resumir investigaciones complejas, necesita absorber cantidades colosales de información de alta calidad.

Aquí surge una cuestión incómoda que durante demasiado tiempo permaneció sin respuesta: ¿De dónde provienen realmente esos datos?

Durante los últimos meses, esa pregunta permaneció envuelta en el misterio, muchas de las compañías hablaban vagamente de “datos públicos”, “contenido licenciado” o “información disponible en Internet”: pero siempre han evitado entrar en detalles concretos sobre sus métodos de recopilación más profundos.

Todo cambió cuando una serie de documentos internos, desclasificados durante un proceso judicial en Estados Unidos, sacaron a la luz uno de los proyectos más controvertidos de la industria de la IA. Su nombre clave: Project Panama.

¿Qué es el Proyecto Panama?

Según los documentos judiciales revelados, la empresa Anthropic (desarrolladora del modelo Claude) puso en marcha un plan meticulosamente diseñado para adquirir cantidades masivas de libros físicos, desmontarlos por completo, escanear cada una de sus páginas mediante procesos industriales y convertirlos en una gigantesca biblioteca digital destinada al entrenamiento de inteligencia artificial.

No se trataba simplemente de digitalizar libros de forma convencional. Era algo mucho más ambicioso y para muchos, profundamente inquietante. Se trataba de construir, de forma silenciosa y a una escala nunca antes vista, una colección de conocimiento que sirviera como combustible para una nueva generación de modelos de IA.

Y según varios documentos internos citados en el proceso judicial, la compañía NO quería que el proyecto trascendiera al público.

El nacimiento de una nueva carrera tecnológica

Para comprender por qué una empresa tecnológica estaría dispuesta a gastar decenas de millones de dólares comprando libros usados para destruirlos, es necesario retroceder apenas unos años.

En noviembre de 2022, OpenAI sorprendió al mundo con el lanzamiento de ChatGPT. Lo que inicialmente parecía una simple demostración tecnológica se convirtió en uno de los productos de mayor crecimiento en la historia de Internet.

En apenas semanas, millones de usuarios comenzaron a utilizar la herramienta para escribir textos, programar, resolver dudas, traducir documentos o generar ideas creativas.

La reacción del resto del sector fue inmediata y contundente:

  • Google aceleró el desarrollo de Gemini.
  • Microsoft invirtió miles de millones de dólares en OpenAI.
  • Meta impulsó sus modelos Llama.
  • Amazon reforzó su apuesta estratégica por Anthropic.

La inteligencia artificial había dejado de ser un proyecto experimental de laboratorio para convertirse en una carrera estratégica de dimensiones geopolíticas.

Aunque existía un problema crítico que pocos conocían fuera de los círculos especializados. Entrenar un modelo de lenguaje moderno no consiste únicamente en disponer de ordenadores potentes. El verdadero desafío, el recurso escaso y diferenciador, reside en los datos..

Cuanto mayor y más diversa sea la información utilizada durante el entrenamiento, mayor será la capacidad del modelo para comprender y generar lenguaje humano con precisión y matices. Y pocas fuentes ofrecen una calidad comparable a la de los libros.

¿Por qué los libros son tan valiosos para entrenar una IA?

A diferencia de la mayoría de las páginas web, los libros pasan por procesos editoriales rigurosos que garantizan un estándar de calidad difícil de encontrar en otras fuentes.

Generalmente incluyen:

  • Información estructurada con principios, desarrollos y conclusiones claras.
  • Lenguaje revisado por correctores y editores profesionales.
  • Vocabulario amplio y preciso, adaptado a diferentes niveles de complejidad.
  • Contextos extensos y complejos que requieren comprensión global.
  • Argumentaciones largas y coherentes que desarrollan ideas a lo largo de capítulos enteros.
  • Menor cantidad de errores ortográficos y gramaticales respecto a contenidos digitales no revisados.

Desde el punto de vista del aprendizaje automático, un libro constituye un conjunto de datos extraordinariamente rico y denso en significado.

Una novela puede enseñar:

  • Construcción narrativa y estructura dramática.
  • Diálogos naturales con diferentes registros lingüísticos.
  • Evolución psicológica de personajes a lo largo del tiempo.
  • Estilos literarios variados y recursos retóricos.

Un manual universitario aporta:

  • Terminología especializada y vocabulario técnico.
  • Relaciones jerárquicas entre conceptos.
  • Explicaciones detalladas con ejemplos prácticos.

Un tratado científico ofrece:

  • Razonamientos lógicos y cadenas argumentativas.
  • Precisión terminológica y metodológica.
  • Información técnica actualizada y revisada por pares.

Para una inteligencia artificial, cada uno de estos textos representa miles o incluso millones de ejemplos de cómo los seres humanos organizan, estructuran y comunican el conocimiento. No resulta extraño, por tanto, que las compañías tecnológicas vieran las bibliotecas como a mina de oro para sus algoritmos.

El problema del copyright

Había, sin embargo, un enorme obstáculo legal que se interponía en el camino: los libros están protegidos por derechos de autor. Una empresa no puede copiar libremente millones de obras comerciales para crear una base de datos privada sin exponerse a demandas millonarias y al rechazo de la comunidad creativa.

Durante años, las compañías exploraron distintas alternativas para sortear este escollo:

  • Algunas negociaron licencias directamente con editoriales.
  • Otras recurrieron a colecciones digitales ya existentes, como proyectos de dominio público.
  • Y algunas utilizaron enormes repositorios de Internet cuya situación legal resultaba, como mínimo, discutible.

Pero en Anthropic surgió una idea diferente, una solución tan simple en concepto como polémica en ejecución: comprar los libros físicos directamente.

Una solución tan simple como polémica

En apariencia, el razonamiento parecía lógico y jurídicamente sólido. Si una empresa compra legalmente un libro, posee ese ejemplar físico. Puede leerlo, puede subrayarlo, puede prestarlo e incluso puede destruirlo si así lo desea.

La cuestión jurídica verdaderamente espinosa aparece cuando decide convertir ese libro en una copia digital permanente para utilizarlo dentro de un sistema de entrenamiento de inteligencia artificial, ¿Es legal escanear un libro completo que se posee físicamente para alimentar un algoritmo?

Durante años, nadie tuvo una respuesta definitiva. Los expertos en propiedad intelectual se dividían entre quienes consideraban que podía ampararse en el “uso legítimo” (fair use) y quienes advertían que constituía una infracción masiva de derechos de autor.

Precisamente, esa incertidumbre legal, fue la que acabaría desembocando en uno de los juicios más importantes de la historia reciente del copyright en la era digital.

Pero antes de que los tribunales pudieran pronunciarse, debía existir alguien dispuesto a ejecutar semejante proyecto a gran escala.

Entra en escena Anthropic

Anthropic nació en 2021 de la mano de antiguos investigadores de OpenAI, entre ellos los hermanos Dario y Daniela Amodei. Su objetivo fundacional era desarrollar modelos de inteligencia artificial con un enfoque centrado en la seguridad y la alineación ética, un propósito que resonó especialmente en una industria cada vez más preocupada por los riesgos existenciales de la IA.

En pocos años, Claude pasó de ser un proyecto experimental a competir directamente con ChatGPT y Gemini en cuanto a capacidades y popularidad. El crecimiento fue meteórico, impulsado por inversiones multimillonarias de gigantes como Google y Amazon.

Pero entrenar modelos cada vez más avanzados y sofisticados exigía enormes cantidades de información de alta calidad. Y ahí, en esa necesidad insaciable de datos, apareció Project Panama.

El hombre elegido para conseguir todos los libros del mundo

Uno de los nombres que aparece con mayor frecuencia en los documentos judiciales es el de Tom Turvey: NO era un empleado cualquiera dentro de la estructura de Anthropic.

Durante años, Turvey había trabajado en Google como una de las figuras clave responsables del histórico proyecto Google Books, una iniciativa titánica que pretendía digitalizar millones de libros procedentes de bibliotecas de todo el mundo. Su experiencia era prácticamente única en el sector tecnológico.

Conocía en profundidad:

  • El mercado editorial y sus complejidades.
  • Los problemas legales asociados a la digitalización masiva.
  • Las técnicas de escaneado industrial y los proveedores especializados.
  • Los acuerdos con distribuidores y vendedores de libros usados.

Anthropic lo incorporó precisamente por ese conocimiento acumulado durante años de trabajo en uno de los proyectos de digitalización más ambiciosos de la historia. Según varios documentos internos citados en el litigio, su misión consistía en encontrar la forma más eficiente de construir una biblioteca masiva destinada al entrenamiento de IA.

No era un trabajo sencillo, había que conseguir millones de libros sin depender exclusivamente de acuerdos editoriales que podían tardar años en negociarse y que además, resultaban económicamente inviables a la escala que la empresa necesitaba.

El proyecto Panama en profundidad

El nombre apenas decía nada más que “Panama”. Un proyecto aparentemente inocente y casi burocrático, aunque detrás de ese nombre, se escondía una de las operaciones logísticas más ambiciosas emprendidas hasta la fecha por una empresa de inteligencia artificial.

Los documentos describen un sistema relativamente simple en concepto, pero titánico en ejecución:

  1. Adquisición masiva de libros: Comprar grandes lotes de libros usados a través de distribuidores especializados y vendedores de segunda mano.
  2. Transporte centralizado: Trasladar los lotes a centros de digitalización industriales.
  3. Preparación destructiva: Cortar completamente el lomo de cada libro y separar todas sus páginas.
  4. Escaneo industrial: Procesar las hojas mediante alimentadores automáticos de alta velocidad, capaces de manejar miles de páginas por hora.
  5. Reconocimiento de texto: Convertir cada página escaneada en texto digital mediante software de reconocimiento óptico de caracteres (OCR).
  6. Incorporación a la biblioteca: Integrar los textos resultantes en una gigantesca base de datos utilizada para entrenar los modelos de IA de Anthropic.

Una vez completado el proceso, los libros originales ya NO podían volver a montarse, deberían ser destruidos irreversiblemente.

¿Qué es exactamente el escaneo destructivo?

Aunque el término suene especialmente agresivo, el escaneo destructivo (destructive scanning) no nació con la inteligencia artificial. Desde hace décadas, se utiliza para digitalizar documentos cuando la velocidad y la eficiencia resultan más importantes que conservar el objeto físico original.

El procedimiento suele seguir varios pasos metódicos:

1. Eliminación de la cubierta: Se retira la portada y la contraportada, dejando únicamente el bloque de páginas.
2. Corte del lomo: Una guillotina industrial elimina el pegamento o cosido que mantiene unidas las páginas.
3. Separación automática: Cada hoja queda completamente independiente, lista para ser procesada individualmente.
4. Alimentación mecánica: Las páginas sueltas pasan por escáneres automáticos de alta velocidad, capaces de procesar miles de hojas por hora sin intervención humana.
5. Reconocimiento óptico: El software interpreta cada imagen digitalizada y la convierte en texto editable mediante algoritmos de OCR.

El resultado es, un libro completamente digitalizado en cuestión de minutos y no de horas. La diferencia respecto a los escáneres convencionales (que preservan el libro físico) es enorme. Mientras un operador manual puede tardar cerca de una hora en digitalizar cuida el libro sin dañarlo, un sistema destructivo puede procesar decenas de ejemplares durante ese mismo tiempo.

Cuando el objetivo consiste en digitalizar millones de libros, la diferencia económica resulta gigantesca y en la carrera por dominar la inteligencia artificial, el tiempo y el dinero son recursos críticos.

¿Dónde consiguieron tantos libros?

Los documentos judiciales indican que Anthropic recurrió principalmente al mercado de segunda mano. Las fuentes incluían distribuidores especializados, vendedores de grandes lotes de libros usados, excedentes de bibliotecas y liquidaciones editoriales.

Desde un punto de vista económico, la estrategia tenía todo el sentido del mundo. Miles de obras podían adquirirse por apenas unos pocos dólares cada una, especialmente aquellas que ya no generaban beneficios significativos para sus editoriales originales.

Pero, precisamente por su contenido rico y diverso, seguían siendo extraordinariamente valiosas como fuente de datos para una inteligencia artificial.

No existen pruebas públicas de que la empresa buscara destruir ejemplares únicos, primeras ediciones o libros de alto valor histórico o bibliográfico: todo apunta a que la prioridad era conseguir grandes cantidades de títulos fácilmente reemplazables, priorizando el volumen sobre la rareza.

Una biblioteca concebida para las máquinas

Resulta llamativo el pensar que, durante siglos, las bibliotecas se diseñaron para que las personas accedieran al conocimiento. Eran templos del saber donde el ser humano podía explorar, aprender y descubrir. Mientras que el Proyecto Panama perseguía exactamente el objetivo contrario.

Los libros dejaban de ser objetos culturales destinados a lectores humanos para convertirse en mera materia prima de una infraestructura informática. Una vez digitalizados, ya no importaban el papel, la encuadernación, el olor característico de las páginas viejas ni la portada diseñada con esmero. Lo único valioso era el contenido textual extraíble.

Ese cambio de perspectiva refleja una de las grandes transformaciones (y tensiones) de la era de la inteligencia artificial. Para los modelos de lenguaje, un libro no es un objeto físico con historia, significado cultural o valor emocional. Es una inmensa secuencia de palabras, frases y relaciones lingüísticas que puede incorporarse a un proceso estadístico de aprendizaje automático.

Anthropic NO quería que se conociese

Quizá el aspecto más controvertido de toda esta historia no sea el escaneo destructivo en sí mismo, sino el tono de algunos documentos internos revelados durante el litigio. Entre ellos aparecen referencias que muestran la preocupación explícita de la empresa por evitar que el proyecto trascendiera públicamente.

Diversos medios estadounidenses citaron documentos en los que se afirmaba que “no convenía que se conociera la existencia del proyecto” y que este debía desarrollarse “con la máxima discreción posible”. Aunque las empresas tecnológicas suelen mantener confidenciales muchos de sus procesos internos por razones competitivas, estas referencias alimentaron un intenso debate sobre la transparencia en el entrenamiento de modelos de inteligencia artificial.

Si el procedimiento era plenamente legítimo desde el punto de vista legal, ¿Por qué tanto interés en mantenerlo alejado del escrutinio público?

La respuesta, posiblemente, no sea únicamente jurídica. También era (y sigue siendo) una cuestión de imagen pública y percepción social. La idea de destruir libros físicos para entrenar algoritmos chocaba frontalmente con el simbolismo cultural que la sociedad atribuye a la literatura y al conocimiento impreso.

En un momento en que la industria tecnológica enfrenta un creciente escrutinio público, cualquier cosa que pudiera percibirse como una agresión a la cultura generaba un riesgo reputacional significativo.


Un debate que apenas comienza

La publicación de Project Panama cambió por completo la conversación sobre los datos utilizados para entrenar inteligencia artificial. Ya no se trataba solo de páginas web, foros de internet o bases de datos públicas. Por primera vez quedó documentado, con pruebas judiciales, que una gran empresa había diseñado un sistema industrial para transformar millones de libros físicos en datos destinados a alimentar modelos de lenguaje.

Las preguntas que surgen son múltiples y profundas:

  • ¿Es ético destruir libros para entrenar algoritmos, aunque su contenido se preserve digitalmente?
  • ¿Deben las empresas de IA revelar públicamente sus fuentes de datos?
  • ¿Qué límites legales existen para la digitalización masiva de obras protegidas por derechos de autor?
  • ¿Hasta dónde puede llegar el “uso legítimo” cuando se trata de entrenar sistemas comerciales?

Sin embargo, la historia estaba lejos de terminar. Porque mientras Anthropic construía su gigantesca biblioteca digital mediante la compra y destrucción de libros físicos, otro problema mucho más delicado crecía en paralelo:

Vistas: 26

Descubre más desde CIBERED

Suscríbete y recibe las últimas entradas en tu correo electrónico.

Scroll al inicio