{"id":7684,"date":"2026-08-22T11:40:26","date_gmt":"2026-08-22T09:40:26","guid":{"rendered":"https:\/\/laverdad.tech\/?p=7684"},"modified":"2026-08-22T11:40:28","modified_gmt":"2026-08-22T09:40:28","slug":"por-que-las-empresas-de-inteligencia-artificial-estan-comprando-millones-de-libros","status":"publish","type":"post","link":"https:\/\/laverdad.tech\/index.php\/2026\/08\/22\/por-que-las-empresas-de-inteligencia-artificial-estan-comprando-millones-de-libros\/","title":{"rendered":"\u00bfPor qu\u00e9 las empresas de inteligencia artificial est\u00e1n comprando millones de\u00a0libros?"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\"><a href=\"https:\/\/theconversation.com\/profiles\/paloma-gonzalez-diaz-2748810\" target=\"_blank\" rel=\"noopener\">Paloma Gonz\u00e1lez D\u00edaz<\/a>, <em><a href=\"https:\/\/theconversation.com\/institutions\/uoc-universitat-oberta-de-catalunya-3540\" target=\"_blank\" rel=\"noopener\">UOC &#8211; Universitat Oberta de Catalunya<\/a><\/em><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Durante a\u00f1os, buena parte de la inteligencia artificial actual se entren\u00f3 con contenidos disponibles en internet. P\u00e1ginas web, foros, art\u00edculos, enciclopedias y repositorios digitales proporcionaron enormes cantidades de texto para ense\u00f1ar a los grandes modelos de lenguaje. Pero la red empieza a mostrar sus l\u00edmites. Algunas empresas tecnol\u00f3gicas han buscado otra fuente de conocimiento y han encontrado en los libros la soluci\u00f3n.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">A <a href=\"https:\/\/www.washingtonpost.com\/technology\/2026\/01\/27\/anthropic-ai-scan-destroy-books\/\" target=\"_blank\" rel=\"noopener\">principios de 2026, <em>The Washington Post<\/em><\/a> revel\u00f3 una de estas estrategias a partir de documentos judiciales relacionados con Anthropic, la empresa responsable del asistente de IA Claude. La investigaci\u00f3n sac\u00f3 a la luz \u201cProject Panama\u201d, un proyecto secreto iniciado en 2024 para adquirir libros impresos a gran escala. Los ejemplares se escaneaban y sus textos se incorporaban a los procesos de desarrollo de modelos de IA. Para acelerar el proceso, millones de libros fueron cortados, digitalizados y despu\u00e9s enviados a reciclar.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">El procedimiento muestra un cambio importante en la forma de valorar el libro. El objeto f\u00edsico pierde importancia frente a su contenido. El texto puede extraerse, convertirse en datos y utilizarse para alimentar modelos de inteligencia artificial.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Anthropic no es la \u00fanica compa\u00f1\u00eda interesada en acceder a grandes colecciones de libros. En mayo de 2026, <a href=\"https:\/\/www.washingtonpost.com\/national-security\/2026\/05\/05\/publishers-sue-meta-ai-copyright\/\" target=\"_blank\" rel=\"noopener\">cinco grandes editoriales estadounidenses y el escritor Scott Turow demandaron a Meta y Mark Zuckerberg<\/a>. Los acusaron de utilizar millones de libros y art\u00edculos procedentes de repositorios piratas para entrenar a su modelo <a href=\"https:\/\/www.wired.com\/story\/meta-is-already-training-a-more-powerful-sucessor-to-llama-3\/\" target=\"_blank\" rel=\"noopener\">Llama<\/a>. Otros litigios contra empresas de IA apuntan en la misma direcci\u00f3n.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Los libros han adquirido as\u00ed un nuevo valor estrat\u00e9gico. Ya no son solo objetos que contienen y transmiten conocimiento. Tambi\u00e9n son grandes conjuntos de datos en la competici\u00f3n por desarrollar mejores modelos de inteligencia artificial.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">\u00bfQu\u00e9 tienen los libros que no tenga internet?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Los grandes modelos de lenguaje necesitan enormes cantidades de texto. Sin embargo, cantidad y calidad no son necesariamente lo mismo.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Internet ofrece una diversidad dif\u00edcil de encontrar en otro lugar. Pero tambi\u00e9n contiene textos breves, repetidos o poco revisados.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Adem\u00e1s, desde 2022, cada vez hay m\u00e1s contenidos creados con IA en internet. Un <a href=\"https:\/\/arxiv.org\/abs\/2604.26965\" target=\"_blank\" rel=\"noopener\">estudio publicado en 2026<\/a> analiz\u00f3 p\u00e1ginas web aparecidas entre 2022 y 2025. A mediados de 2025, alrededor del 35&nbsp;% de las nuevas p\u00e1ginas estudiadas inclu\u00edan textos generados o modificados con IA. Esto no significa que el 35&nbsp;% de internet haya sido creado por m\u00e1quinas, pero s\u00ed muestra que estos contenidos tienen cada vez m\u00e1s presencia en la red.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">El problema no es solo distinguir qui\u00e9n ha escrito qu\u00e9. Una investigaci\u00f3n publicada en <em>Nature<\/em> ya mostr\u00f3 en 2024 que entrenar sucesivas nuevas generaciones de modelos con contenidos producidos por modelos anteriores puede provocar <a href=\"https:\/\/doi.org\/10.1038\/s41586-024-07566-y\" target=\"_blank\" rel=\"noopener\">una degradaci\u00f3n progresiva de los resultados<\/a>.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">En este contexto, los libros anteriores a la expansi\u00f3n de la IA generativa adquieren un nuevo valor. Ofrecen a las empresas tecnol\u00f3gicas contenidos extensos y estructurados que, en muchos casos, han pasado por procesos profesionales de edici\u00f3n y correcci\u00f3n. Adem\u00e1s, han sido escritos por personas.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Cuando el patrimonio se convierte en datos<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Durante siglos hemos creado bibliotecas, archivos y universidades para conservar una parte de nuestra memoria colectiva. Estas instituciones no se limitan a almacenar sus fondos, tambi\u00e9n los catalogan, los preservan y los hacen accesibles.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La inteligencia artificial est\u00e1 dando un nuevo valor a ese patrimonio. No interesa el ejemplar f\u00edsico; importa la informaci\u00f3n que contiene. Al digitalizarlo, el texto puede convertirse en datos y utilizarse para entrenar modelos de IA.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Desde la pasada primavera, <a href=\"https:\/\/elpais.com\/tecnologia\/2026-07-21\/cuando-el-conocimiento-de-internet-ya-no-es-suficiente-la-ia-le-pone-el-ojo-a-las-librerias-de-segunda-mano.html\" target=\"_blank\" rel=\"noopener\">libreros de Espa\u00f1a<\/a>, <a href=\"https:\/\/lesekauz.de\/forum\/thread\/1999-sammelbestellungen-von-zoombooks-c-o-prepfort-usa-%C3%BCber-abebooks\/\" target=\"_blank\" rel=\"noopener\">Alemania<\/a>, <a href=\"https:\/\/www.theguardian.com\/technology\/2026\/aug\/02\/australian-book-sellers-alarm-destruction-rare-titles-ai-supply-chain\" target=\"_blank\" rel=\"noopener\">Australia<\/a> y <a href=\"https:\/\/www.theatlantic.com\/technology\/2026\/08\/ai-companies-buying-used-books-for-data\/688167\/\" target=\"_blank\" rel=\"noopener\">Nueva Zelanda<\/a> han alertado de pedidos masivos y poco habituales realizados por la empresa canadiense Zoom Books. Esta compa\u00f1\u00eda se dedica a la venta de libros de segunda mano por internet. Sus compras suelen realizarse a trav\u00e9s de grandes plataformas como AbeBooks o Biblio. En ellas se pueden encontrar desde t\u00edtulos baratos hasta ediciones raras y dif\u00edciles de conseguir.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Estos patrones de compra \u2013y el precedente de Anthropic\u2013 han despertado sospechas. Sobre todo, por su volumen y por el inter\u00e9s en obras antiguas, descatalogadas o que no est\u00e1n disponibles en formato digital. Zoom Books niega que sea para alimentar a la IA y, por el momento, no existen pruebas concluyentes que permitan atribuirle ese fin.<\/p>\n\n\n\n<figure class=\"wp-block-image\"><a href=\"https:\/\/images.theconversation.com\/files\/754325\/original\/file-20260817-59-ke67lh.jpg?ixlib=rb-4.1.1&amp;q=45&amp;auto=format&amp;w=1000&amp;fit=clip\" target=\"_blank\" rel=\"noopener\"><img decoding=\"async\" src=\"https:\/\/images.theconversation.com\/files\/754325\/original\/file-20260817-59-ke67lh.jpg?ixlib=rb-4.1.1&amp;q=45&amp;auto=format&amp;w=754&amp;fit=clip\" alt=\"Libros amontonados en columnas.\"\/><\/a><figcaption class=\"wp-element-caption\">Las librer\u00edas de segunda mano son un fil\u00f3n de ejemplares descatalogados, ex\u00f3ticos o raros. <a href=\"https:\/\/unsplash.com\/es\/fotos\/una-pila-de-libros-sentados-encima-de-una-pared-pJPE-ZlQVnM\" target=\"_blank\" rel=\"noopener\">Rhamely \/ Unsplash<\/a><\/figcaption><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Pero el fen\u00f3meno muestra hasta qu\u00e9 punto el contenido de los libros ha adquirido un nuevo valor. La informaci\u00f3n puede extraerse del objeto, convertirse en datos y circular de forma independiente. Muchos de estos textos nunca se han digitalizado, y algunos contienen conocimientos locales, especializados o publicados en lenguas con poca presencia en internet. Ofrecen informaci\u00f3n que todav\u00eda no est\u00e1 disponible en grandes bases de datos digitales.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Una nueva carrera por el conocimiento<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Durante los \u00faltimos a\u00f1os hemos hablado de la carrera de la IA en t\u00e9rminos de procesadores, energ\u00eda, centros de datos y algoritmos. Pero la compra masiva de libros pone sobre la mesa otro recurso estrat\u00e9gico, mucho menos visible: el conocimiento humano.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Destruir un ejemplar puede parecer poco relevante cuando existen miles de copias. Pero no todos los libros est\u00e1n en esa situaci\u00f3n. Muchos est\u00e1n descatalogados, tuvieron tiradas peque\u00f1as o pertenecen a editoriales y \u00e1mbitos locales. Otros son dif\u00edciles de encontrar. En estos casos, cada ejemplar que desaparece dificulta el acceso a su contenido.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Tambi\u00e9n importa qu\u00e9 libros se eligen. No todos los conocimientos est\u00e1n igual de representados en los datos que utilizan los modelos de IA. La selecci\u00f3n puede reforzar desequilibrios que ya existen en internet.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La lengua es un buen ejemplo. Tambi\u00e9n lo son el origen geogr\u00e1fico, la \u00e9poca o el tipo de conocimiento. Algunas culturas, perspectivas y formas de entender el mundo pueden estar muy presentes. Otras, mucho menos. Y otras pueden quedar al margen.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">A esto se suma el debate sobre los derechos de autor. Escritores, editoriales y otros creadores cuestionan que sus obras puedan utilizarse para entrenar sistemas comerciales de IA sin permiso ni compensaci\u00f3n. En Europa, <a href=\"https:\/\/artificialintelligenceact.eu\/es\/\" target=\"_blank\" rel=\"noopener\">la normativa sobre inteligencia artificial<\/a> intenta aportar algo m\u00e1s de transparencia. Entre otras medidas, exige a las empresas responsables de los grandes modelos informar sobre los contenidos utilizados para entrenarlos y adoptar medidas para respetar la <a href=\"https:\/\/digital-strategy.ec.europa.eu\/es\/policies\/copyright\" target=\"_blank\" rel=\"noopener\">legislaci\u00f3n europea sobre derechos de autor<\/a>.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La cuesti\u00f3n, en todo caso, no es solo qu\u00e9 pueden aprender las nuevas herramientas tecnol\u00f3gicas de nuestros libros. Debemos preguntarnos qu\u00e9 ocurre con ellos tras su digitalizaci\u00f3n y procesamiento masivo, qu\u00e9 se conserva, qu\u00e9 puede llegar a desaparecer y qu\u00e9 conocimientos quedan fuera. Porque seleccionar los contenidos con los que aprende una IA tambi\u00e9n significa decidir qu\u00e9 voces estar\u00e1n m\u00e1s presentes en sus respuestas y qu\u00e9 sesgos puede reproducir.<\/p>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<p class=\"wp-block-paragraph\"><em><strong>\u00bfQuiere recibir m\u00e1s art\u00edculos como este?<\/strong> <a href=\"https:\/\/theconversation.com\/es\/newsletters?promoted=suplemento-cultural-175\" target=\"_blank\" rel=\"noopener\">Suscr\u00edbase a Suplemento Cultural<\/a> y reciba la actualidad cultural y una selecci\u00f3n de los mejores art\u00edculos de historia, literatura, cine, arte o m\u00fasica, seleccionados por nuestra editora de Arte + Humanidades Claudia Lorenzo.<\/em><\/p>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<p class=\"wp-block-paragraph\"><a href=\"https:\/\/theconversation.com\/profiles\/paloma-gonzalez-diaz-2748810\" target=\"_blank\" rel=\"noopener\">Paloma Gonz\u00e1lez D\u00edaz<\/a>, Assistant lecturer, <em><a href=\"https:\/\/theconversation.com\/institutions\/uoc-universitat-oberta-de-catalunya-3540\" target=\"_blank\" rel=\"noopener\">UOC &#8211; Universitat Oberta de Catalunya<\/a><\/em><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Este art\u00edculo fue publicado originalmente en <a href=\"https:\/\/theconversation.com\" target=\"_blank\" rel=\"noopener\">The Conversation<\/a>. Lea el <a href=\"https:\/\/theconversation.com\/por-que-las-empresas-de-inteligencia-artificial-estan-comprando-millones-de-libros-289431\" target=\"_blank\" rel=\"noopener\">original<\/a>.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>&#8216;Los libros han adquirido as\u00ed un nuevo valor estrat\u00e9gico. Ya no son solo objetos que contienen y transmiten conocimiento. Tambi\u00e9n son grandes conjuntos de datos en la competici\u00f3n por desarrollar mejores modelos de inteligencia artificial.&#8217;<\/p>\n","protected":false},"author":33,"featured_media":7685,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"colormag_page_container_layout":"default_layout","colormag_page_sidebar_layout":"default_layout","_eb_attr":"","_FSMCFIC_featured_image_caption":"","_FSMCFIC_featured_image_nocaption":"","_FSMCFIC_featured_image_hide":"","footnotes":""},"categories":[257,482,528],"tags":[201,467],"class_list":["post-7684","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-cultura","category-ia-robotica","category-libros","tag-ia","tag-wi2"],"_links":{"self":[{"href":"https:\/\/laverdad.tech\/index.php\/wp-json\/wp\/v2\/posts\/7684","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/laverdad.tech\/index.php\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/laverdad.tech\/index.php\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/laverdad.tech\/index.php\/wp-json\/wp\/v2\/users\/33"}],"replies":[{"embeddable":true,"href":"https:\/\/laverdad.tech\/index.php\/wp-json\/wp\/v2\/comments?post=7684"}],"version-history":[{"count":1,"href":"https:\/\/laverdad.tech\/index.php\/wp-json\/wp\/v2\/posts\/7684\/revisions"}],"predecessor-version":[{"id":7686,"href":"https:\/\/laverdad.tech\/index.php\/wp-json\/wp\/v2\/posts\/7684\/revisions\/7686"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/laverdad.tech\/index.php\/wp-json\/wp\/v2\/media\/7685"}],"wp:attachment":[{"href":"https:\/\/laverdad.tech\/index.php\/wp-json\/wp\/v2\/media?parent=7684"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/laverdad.tech\/index.php\/wp-json\/wp\/v2\/categories?post=7684"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/laverdad.tech\/index.php\/wp-json\/wp\/v2\/tags?post=7684"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}