Digital resources in the Social Sciences and Humanities OpenEdition Our platforms OpenEdition Books OpenEdition Journals Hypotheses Calenda Libraries OpenEdition Freemium Follow us

Open this if you aren’t a writer and don’t know how to code, by Laura Paloma

Hola, Laura, ¿Qué te parecería tener un libro escrito por ti…en la mesita del salón, a la vista de tus amigos y familiares? (publishing.ai)

It was while reading “eBook DDoS: Reflections on Spam Publishing” (Soriano, 2025) and “Anmerkungen zu einer dekorativen Literatur” (Bülhoff, 2024) that I discovered the Low-Content Book. Having already self-published some of my own book and zine projects, I was seduced by the idea that a book could be created fast, could generate passive income, could be made by following a tutorial on YouTube (like bread), and most importantly did not need what is usually considered the most crucial element: content. Its content could be as low as its name clearly indicates, whilst carrying the prestige of a label qualifying it as what is still considered the most valuable container of knowledge: the book. Attracted also by the democratization not only of book publishing (made popular in recent years with self-publishing print-on-demand platforms like LuLu), the accessibility to infinite amount of “new” text spewed out by LLMs, but mostly by the democratization of low content, more specifically the luxury or the precarity of the blank page, turning the book into a sheer promise or sculpture of the inevitability of time passing (I can’t remember who says this). Please note that in quantum mechanics nothingness is the space of all possibilities, and this vacuum is essential to our existence. The content of these books, since it is so low, is not to be read but to be thought about, creating what Kenneth Goldsmith calls a “thinkership” rather than a “readership”.

Hola, Laura: ¿Alguna vez has pensado que la única forma de escribir y vender buenos libros es pasar meses investigando, escribiendo y contratando editores? Esos tiempos ya han pasado.

My encounter with the Low-Content Book market questioned my preconceptions on what it means to be a writer and the writing process. Determined to become the author of such a book myself, I signed up for “publishing.ai” an online course on how to publish books and audiobooks on amazon audible. Due to its high cost (1000 $), I did not take the course but instead regularly received promotional newsletters with catchy subject lines personally addressed to me. What became clear in these emails is that the identity of “author” still weighs heavily, and despite the uncreativity of the entire gesture – the use of ChatGPT, the lowliness of the content, the many instructions, tutorials, and guides that you are given to follow – you are still the author of this Low-Content Book, and that is all that counts. ✌︎㋡ You are proudly not writing a single word, and you are the proud author of this gesture. ✌︎㋡

I did not want to take the Low-Content Book and turn it into the next in line fetishised object, the artwork, but instead I wished to explore the performative side of making such a work. So, I asked Ezequiel Soriano to play the role of the AI chatbot and to respond to my prompts in the style and the language of AI; our language of reference was that of OpenAI’s ChatGPT. Over the course of five months, March to July 2025, in a Signal chat that emulated the chat interface of an LLM, we conversed. In his role of the chatbot Ezequiel helped me do market research, find a niche, and a sub niche for my Low-Content Book, create a search engine optimised title and subtitle, make an outline, edit my writing and generate the content for a book we named A Quest in Sandals: Creative Challenges to Unleash the Joy of Discovering New Perspectives – a summer-themed activity book for gifted adults with an afterword written by Andreas Bülhoff. The book includes an appendix that documents our Signal chat conversation. We also translated the book into German, reproducing the idea that the translation of the book, easily done with AI tools, makes it available to sell on more markets. I also wished to create a competitive Low-Content Book market to that of Amazon Kindle Direct Publishing (Amazon KDP), so I uploaded the book to local Swiss online market places like tutti.ch and ricardo.ch (funny for Swiss people).

My wish was to make this project as a fast publishing exercise, in two months, which was quick for an artistic project but slow for a Low-Content Book, and have the quality of the final work reflect this accelerated artistic process. The reality of it was that Ezequiel, my conversation partner, took a week to reply to my prompts, which made the already slowed down process much slower. I, in turn, also started taking more time to reply, needing time to think about how to respond and whether I should stay in my human role and what that meant. I evaluated each word and each formulation for its machine or human qualities. In what ways was my writing already imitating or influenced by ChatGPT language? Envious of his role, I would sometimes respond to him by mirroring his style back to him.

This writing game, an algorithmic practice since we were “rule-based problem-solving” (Pasquinelli, 2023, p.22), could alternatively be named “hallucinatory writing”: an exercise which I would describe as writing and hallucinating at once. “Everything an LLM generates is a hallucination, some just might accidentally be true.” (Tante, 2025) “Hallucinatory writing” is when you write about something that you pretend to have no sensor data for. The equivalent to disassociating from words and symbols, forgetting their connection to one another and to the world, tokenising them so you can process them better. You are generating text that simulates meaning, ideas, and authenticity. Perhaps this is the collapsed post-platform post-internet version of an Oulipo writing experiment or a combinatorial machine with human “software” pretending to lack consciousness.

A big part of the project was a creative uncreative exercise in style: How to create an AI “voice”? How to amplify the chatbot writing clichés that have dissolved into all writing but that already existed there? How to reply to prompts by imitating a LLM logic? One strategy was using AI writing and formatting tropes and clichés, examples of which are documented here: Wikipedia:Signs of AI writing. A lot of this language was already frequently used in advertising, product descriptions, online content and everyday written and oral language before entering AI “vocabulary” and becoming AI “voice”. Another strategy we used was to write empty text, which meant repeating ideas and paraphrasing the same sentence by using synonyms. With this exercise in style, we were simply amplifying this everyday “promotional and advertisement-like language” that we are surrounded by. The absurdity of the exercise is the difficulty that exists in distinguishing between human writing and AI writing since one was trained on the other and they continue influencing one another.

Por muy apretada que tengas la agenda, tienes tiempo suficiente para publicar un libro.
Puede que suene poco realista, pero es cierto.
Este es el momento ideal para publicar libros.
La decisión es tuya, Laura.

The performative side of this project confronted me with the themes of role-play, simulation, and illusion in the history and design of AI. The way we were role-playing the machine recalls the dynamics of The Mechanical Turk, for example, a self-playing chess table built in 1770, in which a man sat inside the table and simulated automation by playing against the human using pulleys and levers. The secret mechanics of this table were not revealed during its lifetime, and people believed the spectacle of automation that was performed to them. The name of the crowdsourced platform Amazon Mechanical Turk is not only a reference to this historic example of human labour masked behind and inside the machine but points to the historic entanglement between human and machinic labour. Today’s “ghost workers” are the ones maintaining the AI industry by labelling and moderating content online; their presence indicates the need for human labour in accomplishing the tasks that AI cannot complete. It is also interesting to note that the design of the industrial machine itself was based on the imitation of the collective diagram of labour, reproducing human hand movements, tools and workers’ know-how. (Pasquinelli, 2023, p.10) The early chatbot ELIZA was designed to make people believe that they were talking to a human. Trained on Rogerian Therapy, the chatbot asked the same pattern of open questions, creating the illusion that it was giving a personalised response to the information it was being prompted with. The Turing test is yet another example of how AI has been trained to replicate human behaviour. In order to pass the test, the machine’s answers must be indistinguishable from human answers. (Soon & Cox, 2020, p.230)

The LLM is programmed to create content that is plausible and trustable; the plausibility of this output is measured through the consistency of the content and context whilst the trustability factor through its ability to mimic human communication (Ludovico, 2024, p.53). The interface then becomes the space where this simulation takes place, its design masking the machinic logic taking place in the latent space, where the prompt is analysed, the training material is compressed, mapped, retrieved, and from which new content is formed. “The industrial characterization of the machine, to be increasingly trustable, has moved toward a progressive embodiment of anthropomorphic properties.” (Ludovico, 2024, p.52) Here Ludovico gives the example of the voice as the most anthropomorphic characteristic given to the machine, as it is the media that we, humans, use to communicate. So with the project A Quest in Sandals we were role-playing an already role-playing and anthropomorphic machine that is trained and designed to imitate human language, logic, and conversation by using “natural language” while trapped inside a user-friendly chat interface.

While researching the subject matter for this text, I came across Tom W. Bell’s website. There he published a text back in 1996-99 about his thoughts on the future of digital-oral culture in which he states the following:

In orally interacting with computers, people in a digital oral culture will thus have to adopt unique patterns of speech. They may well end up thinking a bit like computers, too. Humans come with hard-wired speech programs, of course, but computers could teach us new tricks. When speaking with computers we might, for example, start using “!” (a bang, or click of the tongue) to close files. Such tricks will carry over into and influence speech among humans.

Instead of adopting machine language, we are reproducing AI clichés of “natural language” that LLMs have been trained on: the flat, the generic, the superlative, the empty, the language of advertisement. *You’re Not Imagining It. People Actually Are Starting To Talk Like ChatGPT* What would it mean for us to meet a machine half-way and to attempt to speak its language? And what language would that be? Would it be alphanumeric code? Or would it be Tom W. Bell’s bang and click of the tongue?

Code, the language of the internet, previously reserved for a literate elite, can now be accessed and used by everyone using tools like ChatGPT. Vibe coding, for example, is making the knowledge and skills of coding redundant, with the origin of the final coded product being a prompt formulated in a “natural language” description. *I’m building an app and you’re coming with me!!!* Does the access to coding through LLMs come with the loss in literacy of alphanumeric code? Will “natural language” become the only language? What happens when the interface becomes so anthropomorphized that it disappears completely?

Hola, Laura: Existe un mito muy extendido sobre la autoedición que disuade a mucha gente de siquiera intentarlo:
«
Hay que ser un escritor excepcional para que los libros tengan éxito».
Esto hace años que ya no es cierto.
Y lo es aún menos en 2025.

The uncreative writing and publishing gesture that Goldsmith claimed would cause a big shift in the literary world, similar to how photography or conceptual art challenged the art world, is now a Low-Content Book, self-published and sold via Amazon KDP, co-authored with the machine but promoted and sold as a genius original and the alphanumeric code that was supposed to challenge literary writing is now being prompted by “natural language” and sits in the backend of many more incoming apps APPppppssss…

I make artistic interventions like A Quest in Sandals because it amuses me to take a product that has a conceptual artistic origin but has been “detourned” by late-stage capitalism. My wish is to see it return to the art and literary world after having been transformed and appropriated by the market because it will probably come back as a poorer, prouder, and full-fleshed version of itself *It’s Britney, bitch, and I am back* and then we will be forced to ask ourselves: whose idea was this again?????

Hola Laura, te dejo por aquí la respuesta a por qué hacer Quest in Sandals en un momento de auge del fascismo y tal, espero llegar a tiempo. Es un copy-paste del texto de From shitposting to shitpublishing.

The poetic gestures of shitpublishing are exercises that radically mimic broader postdigital publishing dynamics.A Quest in Sandalsemulate the general dynamic of shitpublishing ai-slop self-help books, re-framing these publishing gestures to ambivalently portray the situation. The critical dimension of these literary gestures lies in the fact that they unveil shitpublishing, reframing it as critical and meticulous observation.

Likewise, the artistic exercises of shitpublishing create a necessary reflection on cultural valorization and our understanding of culture or knowledge. They expose a sort of ideological consensus about books being the guardians of knowledge. Instead of reproducing a Fahrenheit 451-style critical discourse on censorship, they dismantle the technology of the book as inherently emancipatory.

Como aritstas-bufones lo que hacemos es reproducir las dinámicas problemáticas que ocurren en el mundo para poner atención sobre ellas. Como artistas de la copia y el engaño, buscamos ser un espejo cóncavo del mundo, reflejando lo que ya hay haciéndolo más grotesco. No es un arte que proponga nuevos futuros sino un arte de la atención sobre cosas que ya están pasando.

espero que te sirva

Mensaje privado de Ezequiel Soriano a Laura Paloma, recibido el Miércoles, 6 de mayo 2026

Note: The project A Quest in Sandals received funding from City Biel/Bienne and Swisslos – Kultur Kanton Bern. It is available to buy in Deutsch and English on Swiss online marketplaces. It has been published as a digital object by etkbooks Bern, freely accessible here. The project will be presented on 9 October 2026 at 12:00 in the Laboratorio de Filologías Digitales de la Facultad de Filología, Universidad Complutense de Madrid (Edificio A). Free audiobook in Català and Español coming soon.

Bibliography

Bell, T. W. (1996-9). “Forward to the Past! The Rise of a Digital-Oral Culture”. In: Tom W. Bell’s Homepage. http://www.tomwbell.com/writings/DigiOral.html.

Bülhoff, A. (2024). „Anmerkungen zu einer dekorativen Literatur“, in: Sprache im digitalen [technischen] Zeitalter, What Happened to the End of Books Heft 251 September 2024, 62. Jahrgang.

Goldsmith, K. (2011). Uncreative writing: managing language in the digital age. Columbia University Press.

Goldsmith, K. (2015). THEORY. JBE Books.

Ludovico, A. (2024). Tactical publishing: Using senses, software, and archives in the twenty-first century. MIT Press.

Pasquinelli, M. (2023). The eye of the master: A social history of artificial intelligence. Verso Books.

Soon, W., & Cox, G. (2020). Aesthetic programming: A handbook of software studies. Open Humanities Press.

Soriano, E. (2024).  eBook DDoS: Reflections on Spam Publishing. INC Longform. https://networkcultures.org/longform/2024/04/10/ebook-ddos-reflections-on-spam-publishing/.

Soriano, E. (2025). From Shitposting to Shitpublishing. INC Longform. https://networkcultures.org/longform/2025/02/10/from-shitposting-to-shitpublishing/.

Tante. (2025, March 16). It’s all hallucinations. Smashing Frames. https://tante.cc/2025/03/16/its-all-hallucinations/.

“Un patrimonio a disposición de la sociedad y que esta lo utilice me da esperanza de futuro”. Entrevista a Ana Santos, por M. Llamas, A. Sanz y J. Vollmeyer

Ana Santos Aramburo dirigió la Biblioteca Nacional de España entre 2013 y 2024.

ANA SANTOS ┬®Jeosm (15)

Licenciada en Geografía e Historia y especialista en biblioteconomía, desarrolló gran parte de su carrera en la Universidad Complutense de Madrid y posteriormente fue directora de Bibliotecas y Archivos del Ayuntamiento de Madrid y de la Acción Cultural de la Biblioteca Nacional. Durante su etapa al frente de la Biblioteca Nacional, impulsó la digitalización del patrimonio bibliográfico, el depósito legal digital y proyectos de acceso abierto a los fondos culturales. También promovió iniciativas de visibilización de las mujeres en la cultura, como el Día de las Escritoras.

LEETHI: Hoy es 28 de abril de 2026 y estamos Miriam Llamas y Amelia Sanz con Ana Santos Aramburo. Nos interesa incluirla en esta serie de entrevistas a archiveros y bibliotecarios jubilados que vivieron las primeras digitalizaciones y las sucesivas. Ustedes disponen de una experiencia que queríamos rescatar, especialmente con dos ejes principales: El primero sería ¿cuáles son las expectativas no cumplidas de la digitalización?; el segundo tiene que ver con todas las cuestiones relacionadas con la memoria y el archivo, la importancia de la digitalización para construir memoria, una memoria ciudadana que va muy ligada a la construcción de archivos de saber, pero también a la renovación del canon, a la ampliación del acceso a más ciudadanos.

Formulamos estas preguntas por el compromiso ético que nos alienta: nos parece fundamental el reconocimiento de los logros que ustedes han conseguido. Nos gustaría poder trasladar también su experiencia a los tiempos actuales y a otras generaciones.

La primera pregunta gira en torno al ámbito de la digitalización a lo largo de su carrera: ¿qué es lo que ha cambiado en estos años de manera más significativa? Preguntamos porque parece que para las nuevas generaciones lo digitalizado siempre ha estado allí, como si con un clic aparecieran todas las fichas y todos los documentos.

Ana Santos: Bueno, las fichas bibliográficas son una cosa, igual que los catálogos bibliográficos informatizados, y otra cosa es la digitalización. Pero ambas confluyen en una idea que es fundamental; lo que ha cambiado en los últimos años de forma radical y espectacular es el uso de las colecciones y el acceso a la información. Ambas cosas están relacionadas, pero no es lo mismo. Se puede acceder a la información de una manera mucho más rápida, más completa y mucho más fácil que cuando los catálogos manuales existían, aquellos catálogos en fichas. Afecta a todo el espectro de conservación. Por ejemplo, el proyecto Archivo de la web española ha sido muy significativo, especialmente respecto a todo lo que se refiere a la memoria. Pero es cierto que, en mis más de cuarenta años de profesión, lo que ha cambiado radicalmente es el acceso a la información y la posibilidad de usar las colecciones. ¿Y cuál ha sido la consecuencia más inmediata? Pues un mayor conocimiento sobre las colecciones, una posibilidad de investigar y descubrir cuestiones que hasta ese momento costaban muchísimo más. Antes, la inversión de tiempo era mucho mayor y la posibilidad de completar conocimiento era muy escasa en comparación con lo que ahora se puede hacer. Y otra consecuencia importante ha sido la apertura de ese valor, de esas colecciones a cualquier tipo de público. Ahora las bibliotecas, incluso las bibliotecas patrimoniales, como la BNE, están abiertas a todos los usuarios, ya no solamente a los investigadores, como era hasta hace unos años. Cualquier persona puede utilizar esas colecciones.

Esto ha sido la gran revolución y, además, me da mucha esperanza de futuro porque cuando un patrimonio de estas características, de este valor, se pone a disposición de una sociedad, la utilización y la reutilización se incrementa de manera significativa y eso es importante.

LEETHI: ¿Nos puede facilitar algunos ejemplos de reutilización?

Ana Santos: Sí, por ejemplo, hay un proyecto lanzado por la BNE y que se utiliza mucho en colegios. Es la BNescolar, donde se están usando valiosísimas fuentes para desarrollar unidades didácticas en enseñanza media y con temas transversales, no solamente con temas que son curriculares (temas de medioambiente, temas de aceptación del otro…).

LEETHI: ¿Cuáles son los criterios a la hora de seleccionar unos fondos para su digitalización, de dar prioridad a unos sobre otros?

Ana Santos: Cuando se empezó a digitalizar de forma masiva, fue gracias a la ayuda, con una cantidad bastante significativa, de Telefónica, aunque al principio se comenzó a trabajar con pasos muy titubeantes durante unos cuantos años. Se formó un comité de expertos que ayudó a la Biblioteca Nacional a seleccionar los fondos, y lo primero que se digitalizó fue lo más valioso para la cultura española, esto es, lo que tiene un mayor valor patrimonial, entendido por forma o por contenido (por ejemplo, prensa que es única por su contenido, aunque su valor artístico fuera escaso, o aquello que tenía un mayor valor artístico), y de ahí surgió la Biblioteca Digital Hispánica. Pero según se ampliaban las posibilidades económicas, a través de otras ayudas recibidas de Red.es, se empezaron a completar también colecciones (de la obra de Cervantes, del Siglo de Oro, de incunables…). Era necesaria una planificación muy estricta de lo que se iba a digitalizar de acuerdo con el presupuesto del que se disponía cada año. Y después se incorporó un criterio que para mí fue muy importante: el uso. Para ello se abrió una convocatoria pública dirigida a grupos de investigación para que se manifestasen y nos dijesen “Estamos trabajando en esto, necesitamos que lo digitalicéis y que lo digitalicéis todo”. Más tarde se desarrolló una política institucional, por ejemplo, con relación a los autores y autoras cuya obra entraba en dominio público (a los 80 años del fallecimiento del autor/a). Esto se empezó cuando entraban los autores de 1933/1934 y ahora ya se va por el año 1945. También se ha intentado digitalizar bastante obra escrita por mujeres.

Otro criterio que se ha seguido, y hablamos ya de la Hemeroteca digital y no solo de la Biblioteca Digital, ha consistido en digitalizar los títulos de prensa en dominio público. Esto es una empresa complicada porque en algunos títulos que son de larga duración, hablamos de millones y millones de páginas, con una enorme utilización dado que permite búsquedas con OCR.

LEETHI: Nos alegra que menciones ese criterio porque coincide con algunas de nuestras investigaciones ¿A partir de qué año más o menos se han empezado a digitalizar estas obras de mujeres?

Ana Santos: Fue una política intencionada que se hizo no solamente para digitalizar la obra de autoras, sino también para recuperar su nombre. Para ello creamos el Día de las Escritoras y de esto hace once años exactamente. A partir de 2015, no solamente se ha institucionalizado en muchos lugares el día de las escritoras, sino que también se inició una política de exposiciones sobre el legado dejado por algunas mujeres. Estas exposiciones ayudaron a darlas a conocer, y también a digitalizar sus obras.LEETHI: Hemos notado en los últimos años es una ralentización de ritmo y de modos en la digitalización, frente al boom de otros momentos con las apuestas privadas de Telefónica o de IBM en diferentes instituciones. Parece que no interesa tanto a las entidades privadas este tipo de actividades e incluso los grupos de investigación solicitan menos.

Ana Santos: Llevo ya más de dos años fuera de la Biblioteca Nacional y no puedo facilitarte detalles sobre el estado de cuestión ahora. Pero sí es cierto que las entidades privadas ya no invierten como antes. Cuando se acabó el dinero de Telefónica, nos entró pánico porque estos proyectos exigen continuidad… Y con el presupuesto ordinario y la reducción presupuestaria que sufrió la Biblioteca Nacional en la época de la crisis, esto era absolutamente inviable. Ya me parecía un milagro abrir la puerta cada día. Entonces tuvimos que llamar a puertas de instituciones público-privadas como Red.es, entidad empresarial adscrita al Ministerio para la Transformación Digital y de la Función Pública que impulsa todo lo que es la digitalización y la inteligencia artificial. Red.es nos ayudó muchísimo. El primer proyecto fue de cuatro años y fueron ayudas muy significativas que se pudieron prorrogar por otros cuatro años. También nos ayudó para la preservación de la Web que fue el siguiente paso después de la digitalización. Desde luego sin ayuda externa no se puede seguir la digitalización masiva.

LEETHI: Nos gustaría volver a los criterios de selección y a los sesgos posibles. A los investigadores nos importa mucho lo que se digitaliza y lo que no, lo que se selecciona y lo que no. Para las nuevas generaciones, lo que existe es lo digital y más aún en el ámbito de las humanidades digitales que, a su vez, están dominadas por los informáticos que trabajan de manera cuantitativa: quieren cantidad, sin ningún criterio de autoridad. Nos preocupa efectivamente que los investigadores solo trabajen todo lo que hay en línea y que lleguen a conclusiones que, como poco, son osadas. ¿Cree que los bibliotecarios, los archiveros, los documentalistas tienen esta conciencia de la importancia cultural para la creación de una memoria cultural, de una identidad cultural, de un conocimiento? ¿Saben de la importancia de sus decisiones sobre qué se digitaliza y cuándo, porque eso va a marcar, como con el ejemplo de las mujeres, una dirección u otra de la cultura?

Ana Santos: Soy ahora totalmente consciente, pero yo no lo fui hasta que empecé a ver lo que había. La política de género en la Biblioteca Nacional se empezó a aplicar por este motivo: fui consciente de que había muchas mujeres que ni siquiera conocía y cuya obra estaba depositada en la BNE, pero no estaban en ningún canon y había que rescatarlas, darlas a conocer. Pero para esta conciencia hace falta conocimiento: si no conoces, es difícil decidir. Y el peligro está ahí y te doy toda la razón: lo que se utiliza es lo que está en internet y lo que se conoce, lo que existe, pensamos que es solo lo que está en internet y no es así.

LEETHI: Justo es eso lo que nos da miedo y conecta con la siguiente pregunta que queríamos plantear y que tiene que ver con los usuarios: ¿no le da miedo que los usuarios solo utilicen lo digitalizado? ¿Es verdad que la sala general de la Biblioteca Nacional está vacía porque efectivamente todos vamos a la Hemeroteca y solo venimos de forma muy puntual? Por otro lado, ha aumentado de manera exponencial la frecuentación de la Biblioteca Digital o de la Hemeroteca digital. Lo cual quiere decir que los usuarios ya solo miran lo digital. De hecho, mis alumnos y alumnas se niegan a consultar algo que no esté digitalizado y además bien ocerizado.

Ana Santos: Este es un problema porque obviamente todo no está digitalizado. Es un problema de fuentes y un problema de sesgo porque lo que se cita más es lo que está digitalizado completamente: es descargable y así sigue aumentando el sesgo. Es lo que está sucediendo con la IA que produce otros sesgos porque se alimenta, entre otras cosas, de lo que tú le estás enseñando. Con lo cual el rigor de la fuente se ve mermado, aunque la fuente primera de la que se ha alimentado fuese rigurosa en una revista científica acreditada por pares. Porque, cuando pasa un tiempo y esto se está utilizando y tú estás preguntando cosas, la IA contesta y también te pregunta a ti y tú contestas…, todo eso lo incorpora. Con lo cual a medida que esto va creciendo y va creciendo con millones de accesos en todo el mundo, al final, ¿qué es lo que va a ser? No hay control. Si desde el primer momento hubiera habido un control, habrían ocurrido varias cosas: primero, se utilizarían fuentes fidedignas; segundo, se controlaría el uso para poder revertir a los autores los derechos de propiedad intelectual que les corresponden; en tercer lugar, habría que controlar esa retroalimentación que se hace. Pero todo esto es muy complejo y los desarrollos tecnológicos nos arrasan.

LEETHI: Esto concuerda con lo que antes ha nombrado que es el Archivo de la Web española que es un tesoro y, a su vez, un desafío porque, ¿qué se selecciona?, ¿cómo se guarda?, ¿cómo vivió usted todo este proceso?

Ana Santos: Cierto, la web no se puede conservar entera. Pero pensamos que siempre es mejor conservar algo que perder todo, al menos una imagen o un reflejo de la sociedad de en cada momento, porque, sin duda, van a ser una de las fuentes de información del futuro. Hay muchas cosas que solo están en internet. Entonces se empezó con unos criterios que fueron muy generales y que fundamentalmente estuvieron basados en grandes acontecimientos históricos cuya información era digna de ser guardada para que alguien que en el futuro quisiera investigar pudiera tenerlo conservado en la Biblioteca Nacional. Pero, a medida que el proyecto creció, los criterios tuvieron que abrirse. ¿Y cómo se abrieron? Por un lado, lo que se hizo fue implicar a todas las Comunidades Autónomas y nombrar tanto en cada una como en la propia BNE los “Conservadores Web”: bibliotecarias, bibliotecarios que tienen determinados criterios para ver qué hay que guardar en cada momento. En la Biblioteca Nacional, que como sabéis conserva todo lo que se genera en España, no habríamos tenido criterio para saber qué era lo que la Comunidad Autónoma consideraba importante. Por otro lado, se han tenido muy en cuenta los grandes temas de la sociedad del momento: por ejemplo, durante bastante tiempo hubo recolecciones sobre feminismo, medio ambiente, migración, todos los temas que tienen que ver con política internacional o nacional (elecciones autonómicas, locales, generales). Hasta hace unos años hasta se conservaba el perfil en Twitter de los candidatos, pero X ya no lo permite. Esto era muy interesante. Así se van eligiendo unos cuantos temas y una vez al año o dos, dependiendo del momento y de la cantidad presupuestaria de la que se dispone y de las inversiones que hay que hacer, se hace una recolección de dominio: dominio.es, dominio.cat, dominio.eus, dominio.gal y así los contenidos tanto en castellano como en las otras lenguas autonómicas están conservados al menos una vez al año. Pero es muy complejo hacer esto y los problemas de financiación son enormes.

Jean-Pierre Dalbéra, CC BY 2.0 , via Wikimedia Commons

Jean-Pierre Dalbéra, CC BY 2.0 , via Wikimedia Commons

LEETHI: ¿Cuesta que las autoridades entiendan la importancia de digitalizar el patrimonio y conservar la memoria para poder crear memoria?

Ana Santos: Todo lo que se ha hecho en la Biblioteca Nacional se ha hecho con presupuestos extraordinarios, no ha sido con presupuesto propio, con la cantidad que asigna el Ministerio de Cultura todos los años. Como les conté, se empezó con Telefónica y luego ha sido Red.es la que la que ha estado ayudando a la digitalización. Si no, hubiera sido muy difícil. Con estos proyectos ha evolucionado la Biblioteca y también fuimos aprendiendo. Cada vez los procesos de digitalización han sido más eficientes, pues el coste respecto a la producción era menor. Al principio seleccionar los ejemplares y verificar lo que estaba en buen estado para poderlo digitalizar o no, era complejísimo, porque algunos ejemplares estaban sin catalogar, o sin tener registro del metadato, por lo que hubo que iniciar un proceso de catalogación o re-catalogación muy intenso En ese proceso se ha avanzado mucho por lo que se ha conseguido cada vez mayor eficiencia.

LEETHI: En ese sentido había mencionado que, según las posibilidades tecnológicas evolucionaron también fueron cambiando los criterios. ¿A qué se refiere concretamente?

Ana Santos: Cuando hablo de las posibilidades tecnológicas, me refiero a la cantidad de almacenamiento que se podía comprar, porque todo esto exige cada vez más máquinas, igual que más estanterías, cuando te llegan los libros. Comprar memoria e iniciar todos los procesos de preservación digital fue tremendo, porque no se trata de conservar, sino que tiene que haber tres copias. La tercera nunca la conseguimos, si no recuerdo mal, pero la segunda sí. Y eso obliga a comprar máquinas, el doble de todo, triple, cuádruple… En su momento, se estuvo estudiando todo lo que es el almacenamiento en la nube por Amazon. El problema de esto era que nos daba miedo, porque era como trabajar con Internet Archive: cuando yo llegué ya se había empezado alguna recolección, pero no estaba en España, sino en California; no lo habíamos hecho con nuestros servidores. Estábamos pagando por este servicio y lo que daba cierto pudor era tener un patrimonio tan valioso fuera de España. Sobre el año 2015, se trajo todo con la consiguiente preocupación. Pero allí hubo un equipo maravilloso dirigido por Mar Pérez Morillo, y gracias a su trabajo y a la formación que nos ofrecieron otras bibliotecas el proyecto salió hacia delante. Por ejemplo, nos ayudó mucho la Biblioteca Nacional de Francia: los primeros talleres nos los dieron ellos.

LEETHI: Estamos llegamos al final, pero tenemos una última pregunta que nos lleva a nuestro punto de partida cuando hablábamos de promesas no cumplidas: ¿qué sueños no se han hecho realidad? ¿Cuáles son sus decepciones? ¿Cuáles son sus sueños no cumplidos?

Ana Santos: Sueños no cumplidos tengo muchos porque, para empezar, pensamos que teníamos que soñar, o sea, éramos muy conscientes de hacia dónde queríamos ir. Por eso, se inició algo que nos ayudó mucho, como fue la planificación estratégica cuatrianual con la evaluación anual de las actuaciones, porque una cosa eran los objetivos y otra las actuaciones que nos marcábamos cada año, determinadas por la cantidad presupuestaria. Desde luego, con mucho más presupuesto hubiéramos podido hacer mucho más.

¿Qué me hubiera gustado poder hacer? Por ejemplo, digitalizar algo que para mí es relevante como son las obras fuera de comercio, esas obras que protegidas por derechos de autor no te las puedes comprar porque ya no se están comercializando. Estas, con el elevado número de títulos que cada año se editan en nuestro país y todo el problema que hay de librerías, distribución y almacenamiento, son muchas y desaparecen. Así no se puede acceder a grandes obras que están solamente en la Biblioteca Nacional porque se han recibido por depósito legal, por la Ley de Depósito legal. Obviamente en este sueño había que contar con CEDRO (Centro Español de Derechos Reprográficos) y las sociedades gestoras de derechos de autor para las obras no estuvieran en dominio público.

Otra cosa que creo que va a tener mucho futuro, porque evita la digitalización, es la última reforma de la ley de depósito legal (Ley 8/2022, de 4 de mayo, por la que se modifica la Ley 23/2011, de 29 de julio, de depósito legal) porque obliga al depósito de los preprint, los archivos que utilizan los editores para la edición. Ya no hay que digitalizar las obras. Esto es un gran avance, creo que fue una de las leyes más avanzadas de depósito legal de toda Europa cuando se hizo y está funcionando muy bien. Los editores depositan el preprint y luego, desde las Comunidades Autónomas, desde los centros conservadores, cada uno accede a su depósito legal.

¿Y qué otra cosa sería perfecta? De las obras en dominio público, todo lo que está en dominio público, que es muchísimo, queda muchísimo pendiente de digitalizar. Me gustaría que pudiera estar digitalizado, todo lo que está libre que se pueda reutilizar. Y no hablamos solamente de textos o de libros, estamos hablando de muchas obras de arte, de música. En fin, es algo que si se pudiera digitalizar aportaría muchísimo a la sociedad.

LEETHI: Nos interesa muchísimo toda la parte de la utilización de esta oferta parar los usuarios que se ha llevado a cabo.

Ana Santos: Eso es, BNELab, donde se han desarrollado varios proyectos de reutilización de datos y contenidos. Por ejemplo ComunidadBNE permitió que todos los que quisieran pudieran aportar conocimiento para poder, por ejemplo, identificar a personas en fotografías, poder catalogar carteles de teatro. Se hizo otro también muy bonito para incorporar a traductoras que sabéis que siempre están tan olvidadas en las obras: Traducción de…[femenino singular].

LEETHI: Esa es la lucha que tenemos en la universidad por los criterios de autoridad y las fuentes: de dónde viene eso…, esto no es una fuente de autoridad… Y es impresionante el esfuerzo que hay que hacer para que el estudiantado lo entienda.

Ana Santos: Estoy totalmente de acuerdo, hace falta mucha pedagogía. Parece que ahora la búsqueda es mucho más fácil, porque hay muchas más fuentes disponibles, pero precisamente por eso ya no se debe exigir solamente una cita de una fuente, aunque la cites perfectamente, sino un razonamiento lógico sobre esa cita. Es la formación que necesitan: necesitan formarse su propio pensamiento y para eso tienen que reflexionar sobre las ideas que otras personas tuvieron, no las tienen que copiar solamente. Tienen que pensar: ¿será verdad o será mentira?, ¿ayudó o perjudicó a nuestra sociedad? ¿qué aportó científicamente?, ¿qué ha habido después de esto? Necesitamos otra manera diferente de enseñar y otra manera diferente de aprender y otra manera diferente de contar. Porque estamos hartos de ver citas de citas de citas y citas y siempre encontrar lo mismo. Entonces, cuando veo los proyectos que hacéis desde los grupos de investigación es maravilloso porque se aporta un conocimiento que debe servir como referencia.

LEETHI: Una pregunta que se me había quedado en el tintero es la siguiente. Nosotros vivimos a veces una dictadura computacional: lo que se puede hacer y lo que no se puede hacer, lo que les conviene hacer a los informáticos o no les conviene, respondiendo a sus preguntas, a sus prioridades, que muchas veces no son las prioridades de los investigadores. ¿Usted ha sentido esa dictadura que produce funcionalidades que en realidad no vamos a necesitar, pero están de moda y se hacen?

Ana Santos: En la Universidad Complutense estaba más en contacto con los informáticos que en la Biblioteca Nacional, pero sí lo notaba. Me acuerdo que les decía: “Bueno, esto es como cuando llevo el coche al taller y me dicen que se ha roto el embrague y me lo tengo que creer porque yo no entiendo nada de coches”. Con lo cual me tengo que creer todo. Esto exige, por una parte, un mínimo de formación, lo cual supone un esfuerzo tremendo. Recuerdo la primera pantalla con un correo electrónico que para mí fue un shock: unas pantallas negras con letras verdes donde no se podía corregir casi. Por otro lado, exige también tener al lado informáticos “humanistas” que no solamente tengan su formación tecnológica pura y dura, sino que sepan el valor de lo que significa un proyecto de investigación. Tienen que entender el objetivo que va más allá del propio desarrollo informático, de la herramienta. La herramienta es importante, pero lo que hay detrás es mucho más importante porque te va a obedecer según tú la parametrices y, si no tienes el conocimiento para poderlo hacer, es difícil realizarlo. Por eso es fundamental el poder trabajar en colaboración.

“En Patrimonio Bibliográfico, nunca se debe perder el enlace entre objeto digital y objeto material; no pueden independizarse uno de otro”. Entrevista a Marta Torres, por Johanna Vollmeyer y Amelia Sanz

Marta Torres Santo Domingo (1961), licenciada en Historia y doctora en Filología, pertenece al Cuerpo Facultativo de Bibliotecas del Ministerio de Cultura desde 1986. Ha desarrollado su carrera profesional en la Biblioteca de la Universidad Complutense de Madrid, dedicándose en especial al Patrimonio Bibliográfico, de lo que dejan constancia numerosas publicaciones.

LEETHI: Seguimos con nuestra serie de entrevistas con grandes bibliotecarios y archiveros que han vivido los comienzos de la automatización de los catálogos y la digitalización de los fondos: “Promesas (in)cumplidas de la digitalización de los archivos y bibliotecas”. Hoy estamos con Marta Torres Santo Domingo, antigua Directora de la Biblioteca de la Universidad Complutense de Madrid (1993-1999) y luego Directora de Proyectos de Patrimonio Bibliográfico (2000-2007) y Directora de la Biblioteca Histórica y Patrimonio Bibliográfico de la UCM (2007-2021).

Queremos pedirle que comparta con nosotras lo que ha vivido en el ámbito de la digitalización a lo largo de su carrera. ¿Qué es lo que ha cambiado en estos años?

Marta Torres: El inicio de todos los procesos de modernización los empecé a vivir como Directora de la Biblioteca de la Complutense. Y lo más destacable que ha cambiado a lo largo de mi carrera es la introducción de la automatización y la digitalización.

La digitalización, cuando la iniciamos, era parte de una gestión integral de la biblioteca. Nunca la hemos tratado como algo individual o aislado, sino que formaba parte de un enfoque holístico de lo que es la biblioteca.

Por eso quiero insistir en que las raíces de la biblioteca no han cambiado: la misión de la biblioteca a lo largo de mi carrera no ha cambiado. Lo que sí ha cambiado mucho es la evolución tecnológica o las técnicas de gestión, que se han desarrollado en distintos proyectos. Y creo que es fundamental no perder este norte de la misión de cara al futuro. El problema surge cuando se antepone la tecnología a esta misión: entonces la tecnología se puede convertir en un peligro.

LEETHI: ¿Nos puede explicar un poco más qué es para usted este “norte”?

Marta Torres: Yo empecé a trabajar como facultativa con 23 años y esto me ha permitido vivir una evolución completa de este desarrollo tecnológico hacia la digitalización. Para que se hagan una idea de qué significa esto: cuando yo empecé a trabajar, el desarrollo puntero era una máquina de escribir con memoria para hacer las copias de las fichas, porque hasta entonces habíamos trabajado con impresoras de ciclostil, las llamadas “churreras”. Así que he sido testigo de toda esta evolución y de cambios muy significativos. Muchos hablan incluso de una década prodigiosa para los 90: empezamos con la automatización de los catálogos en bibliotecas ancladas en muchos aspectos en el siglo XIX y resultaba fácil avanzar hasta el siglo XXI. Estábamos muy pendientes de lo que estaba pasando fuera de España para tener modelos de referencia y para poder beber de otras experiencias. Nos ayudaba a modernizar los modelos de gestión, a automatizar, a dar mucha más visibilidad a nuestros fondos, enraizarnos con la comunidad de usuarios. Y esto último es la clave. En una universidad como la nuestra, la clave son los investigadores y los alumnos. Trabajamos para ellos. En aquellos años sabíamos muy bien qué es lo que había que hacer y a partir de allí pudimos crear un proyecto muy concreto.

Hay una expresión que tiene muy mala prensa en la actualidad y es “al servicio de”. Sin embargo, yo comprendí desde el comienzo de mi carrera que teníamos que estar “al servicio de”. Esta es mi convicción: que estamos al servicio de la investigación y de la docencia. Esto lo unimos con la responsabilidad social de todo lo que significa custodiar el patrimonio bibliográfico y, a partir de allí, creamos una tercera columna que es la gran difusión de este patrimonio a la ciudadanía, como bibliotecas y universidades públicas que somos.

LEETHI: ¿Qué papel juega en este contexto la tecnología? ¿En qué sentido puede suponer un peligro para perder de vista el objetivo que nos acaba de dibujar?

Marta Torres: La tecnología tiene que estar a nuestro servicio también. Al principio, cuando empezamos a automatizar y queríamos introducir un dato o realizar una gestión, algún técnico nos decía “el sistema no lo permite”. ¿Cómo puede ser que no lo permita? Pues, haz que lo permita. Hay un punto en que los sistemas tienden a independizarse y se crea una superestructura tecnológica: una nueva construcción social de la realidad con enormes desafíos en los que la clave es no perder el control humano. Me refiero a estructuras de burocracia tecnológica, de organización y control, que responden a intereses ajenos a nuestras necesidades.

Así que, al igual que la biblioteca ha de tener muy claro el servicio que presta, la tecnología también tiene que dar este servicio y no crear una superestructura burocrática independiente y peligrosa. A esto me refería cuando decía que se puede perder fácilmente el norte. En las bibliotecas y en cualquier aspecto de la vida. Es uno de los grandes debates y desafíos de la sociedad actual.

LEETHI: Entonces, a su juicio, ¿qué es lo que más ha cambiado debido al desarrollo tecnológico dentro de este panorama que nos acaba de describir?

Marta Torres: Lo que más ha cambiado es la visibilidad. De la Biblioteca Complutense se sabía ya antes que era una gran biblioteca, pero en los años 90 se hablaba mucho más de la Biblioteca de Salamanca o del Escorial y, por supuesto, de la Biblioteca Nacional. No teníamos la visibilidad de ahora. Y esta potencia que tiene ahora va muy ligada a la automatización y a la digitalización. Tiene una utilización masiva y lo que buscas lo encuentras; esto es lo que más ha cambiado.

Por otro lado, los procesos de descripción o de normalización que hacíamos ya antes no han cambiado tanto, se han incorporado otras codificaciones y se han automatizado los procesos.

La digitalización nos ha aportado también avances en la preservación física de los documentos. Permite mimar más los documentos; no sé si esto es causa o consecuencia de la digitalización, pero hemos podido intervenir en proyectos de conservación y preservación física de los fondos importantes.

LEETHI: ¿Nos podría dar un ejemplo concreto para entender mejor cómo se materializa esta conservación?

Marta Torres: Antes de digitalizar cualquier documento hay que realizar un estudio previo de su estado, qué ediciones existen, si hay documentos que por formato no se pueden digitalizar o por su estado delicado, etc. Teníamos claro que hay documentos que no podían pasar por las máquinas por su estado de conservación.

Otro cambio que me gustaría resaltar es la alta accesibilidad a todos los niveles. Ahora contamos, por ejemplo, con proyectos de Humanidades digitales de apoyo a la investigación, o de innovación docente que aprovechan los fondos para mejorar la docencia sobre libro antiguo o sobre conservación, por ejemplo, pero también para la ciudadanía. En este contexto, la clave fue la Ley del Patrimonio Histórico de 1987 que fue muy moderna –yo diría casi pionera en Europa–. Se hablaba de que el cuidado del patrimonio solo tiene sentido si es para el disfrute de la ciudadanía. La ley lleva implícita esa responsabilidad social.

LEETHI: ¿Y esta responsabilidad hacia la ciudadanía en qué se traduce concretamente?

Marta Torres: La digitalización, por supuesto, ayuda mucho en este sentido, porque garantiza una mayor accesibilidad. Pero también hemos abierto las puertas a un público que antes no venía a bibliotecas patrimoniales. Participamos en la Semana de la Ciencia, Madrid otra mirada, colaboramos en proyectos incluso globales como la Memoria del Mundo de la UNESCO, apoyamos la investigación, la divulgación, organizamos exposiciones como actividad de transferencia de conocimiento de grupos de investigación, visitas guiadas, etc.

LEETHI: Nos gustaría repasar el proceso de digitalización en la Biblioteca de la UCM, desde las primeras digitalizaciones en el proyecto Dioscórides pasando por la digitalización masiva con el Proyecto Google y llegando a la actualidad: ¿Cómo se desarrollaron? ¿Qué criterios se tuvieron en cuenta en cada momento?

Marta Torres: Dioscórides nació en 1995, que es cuando se firmó el proyecto, aunque la digitalización la incluimos ya como objetivo entre las líneas de trabajo de gestión integral del patrimonio bibliográfico en 1994, cuando diseñamos la creación de la Biblioteca Histórica de la Universidad Complutense. Tuvimos un importante socio que fue la Fundación de las Ciencias de la Salud (FCS). Con ella la UCM llevaba muchos años colaborando para elaborar cada año un facsímil de un libro de la colección médica. Era de mucho prestigio porque nos daba mucha visibilidad y servía también para la promoción de lo que hacíamos. A partir de ahí, decidimos dar un salto más allá del facsímil y comenzamos a digitalizar textos históricos impresos. La parte técnica supuso empezar de cero. Apenas había proyectos similares en España y los que había no nos servían como ejemplo o patrón para lo que queríamos hacer nosotros. Fue un momento de colaboración muy interesante con unos informáticos fantásticos de la Universidad Complutense y juntos íbamos aprendiendo cómo desarrollar el proyecto. Había que plantearse y contestar a un montón de preguntas, por ejemplo, qué resolución sería la adecuada, qué estándares había que usar, etc.

Quiero destacar aquí la valiosísima labor de Pilar Moreno García, Directora del Proyecto Dioscórides desde 1995 y Subdirectora de la Biblioteca Histórica desde 2006 hasta su jubilación en 2018, y de Mercedes Cabello, especialista en patrimonio bibliográfico y Subdirectora de la Biblioteca Histórica entre 2018 y 2021.

Lo que se digitalizó no fueron manuscritos, sino impresos. En Dioscórides se decidió empezar con los grandes nombres de la salud y de la alquimia. Empezamos con los incunables médicos y luego, para el siglo XVI, había que dar respuesta a fondos de Medicina y Farmacia, algo de Veterinaria… También se digitalizaron libros que estaban en Filología y Derecho de tema biomédico. Allí nos topamos con problemas de selección.

Como era un proceso muy lento, se llamaba proyecto boutique (proyectos sobre un conjunto pequeño de obras, seleccionado). Eran obras míticas de un especial valor y así también se daba más prestigio al proyecto.

LEETHI: Esa fue una etapa relevante. Otra fue la colaboración con Google. ¿Nos puede comentar más detalles acerca de ella?

Marta Torres: El proyecto Google nos puso realmente en el mundo. Participamos en proyectos internacionales, colaboramos con proyectos europeos de investigación, nos familiarizó con todas las cuestiones técnicas relevantes – enlaces, hipertexto, formatos, etc. El proyecto Dioscórides fue un proceso de formación tecnológica muy importante, pero, por supuesto, tenía sus límites. En 10 años se digitalizaron 3.000 libros. Sin embargo, con Google tuvimos la oportunidad de una digitalización masiva. En este sentido José A. Magán, Director de la Biblioteca Complutense y responsable de la firma con Google, y Manuela Palafox, Servicio de Edición Digital y Web y luego Directora de la Biblioteca Complutense, hicieron un trabajo magnífico. Yo lo viví ya desde la Biblioteca Histórica, donde estaban la mayoría de los fondos patrimoniales que se digitalizaron. Gracias a esta colaboración conseguimos figurar entre bibliotecas punteras como la de Oxford o Harvard.

Y ¿por qué Google? Pues Google nos buscaba a nosotros. Supongo que quería colaborar porque necesitaron un socio hispano ya que tenían digitalizadas muchas fuentes en inglés y se daban cuenta de que había muy poco en español. Y creo que la colaboración entre la UCM y Google fue una decisión magnífica.

LEETHI: Sin embargo, la decisión provocó cierta polémica.

Marta Torres: Si, es cierto. Fue polémica porque entonces se estaba intentando en Europa crear un proyecto del que luego nació Europeana. No se vio con buenos ojos colaborar con estadounidenses y encima una empresa privada. Había temores de “vender nuestro patrimonio europeo a los americanos”. Pero todo esto se quedó en nada. De hecho, cuando se creó Europeana las primeras bibliotecas que entran son las de Google.

Nunca sabes lo que hay detrás de estas polémicas, pero había, quizás, desde luego una cuestión de identidad. Pero la UCM hizo muy bien sus deberes y se garantizó una copia propia. Luego se llevó todo a HathiTrust.

Pero ni entonces ni ahora había un proyecto nacional relevante de repositorio de imágenes digitalizadas. Hispana, por ejemplo, es un repositorio de metadatos. Pero no hay ninguna iniciativa nacional de repositorios de imágenes lo que complica la vida de muchas instituciones, como la UCM, que no tienen la capacidad de tener grandes centros de datos para almacenar grandes cantidades de fuentes digitalizadas. Hay universidades que los están llevando a Internet Archive.

LEETHI: ¿Nos puede describir con un poco más de detalles cómo se llevaba a cabo el proceso de digitalización con Google?

Marta Torres: La digitalización fue masiva. Este fue el objetivo. El único criterio era la temporalidad, es decir, que los documentos estuvieran fuera de la protección de derechos de autor. Se pusieron muchas salvedades en el contrato para no pillarnos los dedos –se extendió, por ejemplo, la vigencia de los derechos de autor por veinte o treinta años más de lo legalmente estipulado–. Otro criterio fue la preservación material: no se digitalizó ningún libro en condiciones “precarias”; es decir, libros frágiles, con páginas sin abrir o de grandes formatos. Y otra decisión importante fue no digitalizar manuscritos, aunque nos dieran todas las seguridades del mundo.

Realmente, las únicas limitaciones que nosotros tuvimos eran materiales, de formato: el tamaño claramente era una limitación. Pero las decisiones nunca las tomó Google.

LEETHI: Siguiendo con los sesgos, ¿existe una consciencia sobre ello entre las personas que trabajan en una biblioteca? ¿Se suelen debatir esos posibles sesgos?

Marta Torres: Sesgos como género, clase o raza son generales de la vida y se trasladan a las bibliotecas. Los fondos que tiene la biblioteca responden a lo que ha querido adquirir la comunidad académica. Los bibliotecarios en una biblioteca universitaria no suelen hacer esta selección en la adquisición, sino que es el profesorado quien decide lo que habrá en los fondos. Y hay sesgos sociopolíticos en las colecciones que reflejan las circunstancias de cada momento del pasado. Por ejemplo, en los años 40 la Biblioteca Complutense recibió importantes donativos de literatura alemana en la que había muchos libros del nacionalsocialismo, como mostré en mi tesis doctoral. Y en la posguerra hubo quemas, purgas y censuras. Por el contrario, hay poca bibliografía sobre China porque no había estudios de Asia Oriental, mientras que ahora el interés sobre China ha crecido mucho, y tenemos pocos recursos sobre esta región. Al final la biblioteca es un espejo de los intereses de la comunidad académica y de la selección que se hace en cada momento. Si la bibliografía en una materia es anglosajona, habrá un sesgo anglosajón. Si otra materia carece de investigadoras mujeres, el sesgo será de género. Si no hay investigación puntera en español en una rama de la ciencia, no habrá citas en español. Y todo esto se trasladará a los grandes repositorios digitales de datos de los que luego beberemos todos. No es un problema de la digitalización, sino del mundo real. Lo que pasa es que la digitalización amplía y multiplica las consecuencias.

Los bibliotecarios somos conscientes de esto porque lo vemos. Se ve lo que se compra y se compra lo que los profesores nos piden. No sé si los bibliotecarios somos más conscientes que cualquier otro ciudadano con un mínimo de formación.

Es que una forma de selección sobre lo que se digitaliza se rige por lo que piden los investigadores: cuando se consigue financiación para un proyecto se recurre a estas peticiones para ver qué es lo que interesa a la comunidad científica.

Otro sesgo es perder el enlace digital al material y crear lo que Simón Díaz llamaba la “bibliografía negativa”: libros perdidos o fantasmas, estos últimos algo habitual en el mundo antiguo. Alguien mencionó una publicación y hay que calibrar si este libro realmente existió o si alguien hizo una referencia equivocada, para luego ir copiando y copiando y de ahí crear una edición fantasma. Ya hay obras digitalizadas navegando por las redes, o investigaciones publicadas en las que se ha perdido la referencia al ejemplar concreto, en qué biblioteca está, etc. Depende de la investigación esto es algo crucial.

LEETHI: Otra limitación importante que se puede entender como sesgo es la financiación, ya que se requiere de una inversión importante para la preservación y también para la digitalización y el mantenimiento de lo digitalizado. ¿Comparte esta visión?

Marta Torres: Totalmente. A diferencia de lo que se piensa, la digitalización requiere muchos más recursos que los documentos analógicos. Es carísimo, sobre todo el mantenimiento. La universidad nunca ha financiado ningún gran proyecto de digitalización sola. Siempre han sido colaboradores externos como, por ejemplo, la Fundación Ciencias de la Salud, Google, el Banco Santander, también el Ministerio de Cultura.

LEETHI: ¿Nos puede comentar también qué pasó después de la digitalización con Google?

Marta Torres: Se han ido aprovechando diferentes proyectos de financiación del Ministerio de Cultura. Primero digitalizamos la colección de grabados de Piranesi, magníficamente estudiados por Juan Manuel Lizarraga, el actual Director de la Biblioteca Histórica. Luego los manuscritos que no se habían hecho con Google. Empezamos con los 150 primeros códices medievales, la colección cisneriana que nos permitió posteriormente realizar el Catálogo de Manuscritos Medievales de la Biblioteca Histórica, un auténtico trabajo codicológico que va más allá de la digitalización. Porque digitalizar es complejo, pero crear un catálogo codicológico completo y útil, es otra cosa, es un trabajo de alta investigación.

Se creó también un catálogo muy interesante sobre manuscritos bibliográficos que supone un inventario importante desde el siglo XVI para poder realizar estudios de procedencias, de compras, para hacer una foto fija de un momento determinado. Y decidimos también digitalizar esos manuscritos.

Estos proyectos son un ejemplo de que para los especialistas en Patrimonio Bibliográfico la digitalización es un instrumento más en la gestión integral de la colección al servicio del apoyo a la investigación, no una herramienta aislada.

Yo ya estoy jubilada, pero imagino que la Biblioteca Histórica, como todas las bibliotecas patrimoniales, seguirá tomando sus decisiones y llevando a cabo sus proyectos de digitalización con esta perspectiva integral.

LEETHI: Finalmente, hablemos de decepciones y sueños: ¿Cuáles serían las promesas no cumplidas de la digitalización? ¿Lo que en algún momento esperaba y no ha sucedido? ¿Y cómo le gustaría imaginar el futuro de las bibliotecas y archivos en un escenario profundamente digital, con tantos datos, con nuevas tecnologías, con ciudadanos que tienen expectativas distintas?

Marta Torres: Yo noto ahora una ralentización y cierta desorientación. Hubo una fase de mucho progreso en la digitalización con unos objetivos muy claros y ahora parece que no se tiene muy claro a dónde hay que ir. También yo estoy jubilada y no sé si habrá habido grandes hitos que desconozco, que podría ser.

Faltan proyectos de investigación que pidan a los bibliotecarios sus conocimientos de digitalización. Hay muy pocos proyectos integradores nacionales, como Hispana, el Catálogo Colectivo del Patrimonio Bibliográfico, Rebiun… Tampoco veo grupos de investigación insistiendo en la necesidad de más digitalización.

Me he dado cuenta de que este torbellino en el que estuvimos se ha parado. No veo grandes avances.

LEETHI: Tenemos la impresión de que las autoridades viven en la creencia de que ya está digitalizada la mayor parte de nuestro patrimonio cuando según las encuestas del observatorio ENUMERATE en 2015 apenas el 10% del patrimonio europeo lo está. Por lo tanto, parecen no estar de moda los proyectos de digitalización y no se conceden fondos de financiación tan necesarios. Nos tememos que se llevan a cabo investigaciones a partir de este 10%, lo cual puede llevar a generalizaciones equivocadas. Porque, además, lo que está digitalizado muchas veces es canónico y conservador. A eso se añade que las prisas en los proyectos de investigación no ayudan a paliar esta presuposición errónea: constatamos finalmente que muchos investigadores ya no van a los archivos físicos y recurren sobre todo lo que encuentra digitalizado. ¿Comparte usted esta observación?

Marta Torres: Les voy a decir una cosa al respecto. Vuelvo a la superestructura burocrática tecnológica. Esta es paralela al mundo real. Los libros están en las bibliotecas. Y ustedes pueden ir a la biblioteca como se ha hecho siempre. Si se trabaja con patrimonio bibliográfico la digitalización ayuda, pero el trabajo de investigación con el mundo material es importantísimo. Esto es algo que me preocupa mucho con la digitalización: a veces se digitaliza solo un ejemplar entre muchos otros, pero si quiero estudiar a fondo una colección tengo que ir a las fuentes originales y materiales. Hay que darse cuenta de que lo que encuentras online es solo una parte de la imagen completa. Y hay vida más allá de los repositorios digitales.

Por eso quiero hacer hincapié en la importancia de esas fuentes materiales. Para ello podemos volver a los catálogos colectivos. En la Staatsbibliothek de Berlín hay un catálogo de incunables que es fundamental, porque durante la Segunda Guerra Mundial desaparecieron muchos documentos e incluso la información sobre estas fuentes se había perdido. Solo se conservan en el catálogo manual de viejas fichas. Por eso digo que una cosa es el mundo virtual, otro el físico. Es fundamental darse cuenta de que el objeto digital está ligado a un objeto material.

LEETHI: Es cierto. Nos quedamos con la idea de dos mundos en paralelo. Coméntenos ahora más sobre sus sueños.

Marta Torres: En primer lugar, me gustaría hablar de los catálogos colectivos o grandes buscadores. Yo sigo soñando con más y mejores, con datos enlazados a múltiples fuentes de datos. En esto, Xavier Agenjo (véase la entrevista en el Blog Rec Lit del 21/02/2026) es un experto y siempre está en la vanguardia, indicando caminos por lo que transitar.

En segundo lugar, quiero resaltar que dentro de los proyectos digitales los procesos de OCR (Optical Character Recognition), una tecnología que convierte imágenes o documentos escaneados en texto digital editable, no avanzan mucho. Son necesarios procesos mejores y más fiables.

En tercer lugar, tengo mucha esperanza en la traducción automática con la ayuda de la inteligencia artificial. Hablábamos de sesgos: muchos libros que están, por ejemplo, en latín ya no se consultan. Si están traducidos quizá, pero si no, es como si no existieran. Y sin embargo son muy importantes y parte de nuestro patrimonio intelectual.

Y, por supuesto, hay que mejorar los portales de las bibliotecas digitales y su relación con los catálogos de las bibliotecas.

Esto es una visión de alguien que está jubilada. Además, cuando hablo de digitalización, siempre me refiero a la digitalización del patrimonio bibliográfico, no a las cantidades ingentes de objetos digitales que nacen así desde su inicio y han de tener otro tratamiento. Yo ni me atrevía a soñar con lo que se ha conseguido. Hoy en día parece que está todo digitalizado como si nada, pero fue un reto logístico y de un trabajo increíble. Entre los años 2008 y 2011 se digitalizaron 80.000 libros en la Biblioteca Histórica de la Complutense (ahora hay más de 170.000 libros digitalizados en toda la Biblioteca Complutense): había que catalogarlos previamente, había que moverlos –caben entre 20 y 30 libros en un carrito– llevarlos a la máquina para digitalizarlos, luego procesarlos, etc. La logística de automatización de Google fue impresionante. Y quiero destacar de nuevo el trabajo de José A. Magán y Manuela Palafox, porque precisamente esta “microhistoria” nos muestra la implicación de las personas, el trabajo manual que se esconde detrás de un proceso de digitalización tan exhaustivo y también nos explica por qué es tan caro y por eso es necesaria una inversión constante.

Pero me preguntabais por sueños: Mis sueños son siempre que la Biblioteca Complutense, en la que he desarrollado toda mi carrera, siga en la vanguardia: sueño con que avance la actual biblioteca digital; que se incluyan nuevas narrativas, por ejemplo de género, como la que ya se está construyendo en la Biblioteca Histórica; que se pueda seguir la fortuna del ejemplar recuperando las evidencias materiales de los ejemplares y las antiguas procedencias, como también ya aparecen en https://biblioteca.ucm.es/historica/procedencias-1; también sueño con que se amplíe el concepto de Patrimonio incluyendo otros tipos de materiales como grabados, fotografías, dibujos, los fondos personales, etc. Que se consiga más financiación para nuevos proyectos…

Para todo ello, la digitalización es una herramienta más, entre otras muchas, que las bibliotecas patrimoniales tienen que utilizar, siempre con la misión que tenemos encomendada por la Universidad: el apoyo a la investigación, la docencia y la difusión.

Sobre Data Blindness, por Paulo Gatica

Paulo Gatica (Universidad Complutense de Madrid)

Google Data Center, Council Bluffs Iowa
Google Data Center, Council Bluffs Iowa

Acerca de la cibercultura conviene recordar que apenas es posible apreciar las capas superficiales del fenómeno[1]. Lo observable, en cierto modo, ya ha pasado; los “adelantos” nunca son sincrónicos ni universales: se impone la especulación para hablar del presente y proponer “otro modo de conocimiento”, que “se mueve en el como si, el imaginemos y el supongamos” (Ludmer, 2010: 10). Precisamente, lo más real de las infraestructuras digitales se halla en lo que no conocemos ni experimentamos de manera directa. Sin ir más lejos, los centros de datos –entiéndase la economía, la política, la sociedad, la cultura del dato– parecen pensados para ser vistos e interpretados fuera de campo: se sabe que están ahí porque vemos sus efectos, los indicios, los resultados de su aplicación, aunque en general convertidos en guarismos o en normativas y, con fortuna, denunciados por grupos activistas. Concretamente, en este ensayo me detendré en el limbo inmaterial en el que se ha situado el centro de datos, auténtica clave de bóveda de la digitalidad y uno de los elementos menos advertidos a la hora de valorar las consecuencias medioambientales que acarrea su exponencial implantación en el territorio.

La digitalización y la datificación masivas acarrean la ampliación de las capacidades de la infraestructura digital al completo y, por ende, un mayor consumo energético, de materias primas, de recursos hídricos, etc. Respecto a los centros de datos, surge inevitablemente la pregunta sobre su materialidad, al menos, en un doble sentido: en primer lugar, se refiere a la infraestructura que sustenta un sistema interconectado de comunicación, almacenaje, programación y distribución de datos, así como todos los otros sistemas que garantizan la operatividad del centro –la electricidad, el mantenimiento del edificio o la viabilidad económica y legislativa–. En segundo lugar, habría que contemplar otra dimensión de su materialidad, quizá más difícil de advertir pese a su aparente evidencia: aunque sus dimensiones compiten con las de otros edificios monumentales y su influencia en una cotidianeidad hipertecnológica es evidente, no se han escrito tantas líneas sobre su espacialidad.

Un centro de datos es, ante todo, una infraestructura y una arquitectura que ocupa un lugar concreto en el mundo y produce lugares en el mundo. No obstante, se trata de una espacialidad que parece distribuida y desterritorializada. Se sabe –en teoría– qué hace/qué ayuda a hacer un centro de datos (al menos la versión edulcorada de los Big Data), pero poco se sabe acerca de su ubicación vinculada con el territorio. En este sentido, su existencia es cierta, pero invisible para el común de los mortales, alejada de la visión directa y quintaesenciada por la dimensión digital del ciberespacio. Es más, su condición de existencia solo es reconocida a partir de ciertos efectos y casi siempre a posteriori: un aumento en la demanda de energía eléctrica, el vaciamiento de pantanos y otras reservas de agua para regadíos o consumo humano, la especulación y recalificación de terrenos públicos, la legislación a la carta para reducir cargas impositivas a las grandes empresas tecnológicas… Desde esta perspectiva, la realidad de los centros de datos es tan abstracta como opaca; aunque los grandes centros requieren para su construcción y puesta en marcha de un gran número de cuerpos, maquinarias e inversiones, son reconocidos formalmente por medio de diagramas, presupuestos y normativas.

Por otra parte, a nivel discursivo se comprueba fácilmente en prensa y en los comunicados corporativos y gubernamentales que un centro de datos es concebido como un generador de riqueza, de empleo y de innovación para la zona en la que se instala. Es, además, una suerte de profecía autocumplida, ya que esta fe en sus ilimitadas posibilidades se sustenta más en la performatividad discursiva que en los hechos contrastables. Incluso cuando se ofrecen cifras e informes que avalarían las bondades del centro, su lenguaje se corresponde con el de las sociedades crecentistas, cuya escala de valores se mueve en términos absolutos entre el menos y el más, pero filtrado por un léxico y una retórica coherentes con el greenwashing capitalista. Véase, por ejemplo, el Climate Neutral Data Center Pact (https://www.climateneutraldatacentre.net/), firmado por un centenar de empresas que representan a centros de datos o que poseen/operan centros de datos en el espacio común europeo, cuyo subtítulo supone un excelente resumen: “the Green Deal needs Green Infrastructure”.

De acuerdo con Hwaiyu Geng (2021: 6), editor del muy recomendable Data Center Handbook, los componentes clave de la infraestructura de un centro de datos son los siguientes: un sistema mecánico con un sistema de refrigeración sostenible, sistemas de distribución eléctrica y de respaldo, sistemas de rack y cableado, sistema de gestión de la infraestructura del centro de datos, un plan de restablecimiento del servicio ante desastres para garantizar su continuidad, una gestión “virtualizada” gracias al software, y un modelo de servicios en la nube. Ciertamente, esta compleja infraestructura ha de ser bien alimentada por el sistema eléctrico, aunque afloran de inmediato las limitaciones actuales a la hora de ofrecer un flujo constante de energías “limpias”. Al respecto, Nuoa Lei y Eric Masanet (2021: 21) argumentan en dicho manual que los centros de datos han de considerar tres factores principales en relación con el uso de fuentes de energía renovables: primero, los centros de datos pueden no tener acceso directo a electricidad renovable a través de las redes locales; en segundo lugar, incluso en aquellas zonas con fuentes de energía renovables adecuadas para los centros de datos, estos no cuentan con suficiente terreno o espacio aledaño o en el propio edificio para la autogeneración, debido a las altas demandas de energía que supone un centro de datos medio. Tercero, como consecuencia del carácter “intermitente” de algunas fuentes de energía renovable, como la solar o la eólica, los centros de datos han de depender parcialmente de las redes locales para obtener una fuente de energía constante y sin interrupciones o, en todo caso, recurrir a formas costosas de almacenamiento de energía.

Por otra parte, además de los habituales cálculos de consumo de datos y de energía, habría que valorar la cada vez más relevante “huella de agua”[2] de los centros de datos. Según Farfan y Lohrman (2023: 4-5), hay sobre todo dos factores que influyen de manera directa e indirecta en dicho consumo de agua: por un lado, derivaría indirectamente de la cantidad de agua empleada en la generación de electricidad, ya que, en función de la fuente de energía, puede variar en gran medida; por otro, se ha de mencionar el gasto directo de agua para la refrigeración de los centros de datos. Este consumo resulta, sin duda, el más polémico, pues se han propuesto y abierto nuevos centros en zonas muy tensionadas por la escasez de agua.

Pese a todo lo expuesto, una parte muy significativa de los estudios sobre la cibercultura han adoptado enfoques tecnofílicos –cercanos terminológicamente a determinadas corrientes posmodernas– en sus análisis de la web, entendida como espacio inclusivo, antijerárquico y democratizador per se. Ahora bien, la problemática de concebir el centro de datos como un remedo de no lugar o una suerte de espacio cero de la comunicación digital consiste en mantener el statu quo alcanzado tras continuas repeticiones de mantras desterritorializadores-desmaterializadores y capas de greenwashing; es más, estas maniobras que buscan deliberadamente difuminar su arquitectura, así como su ordenamiento en el territorio alientan una suerte de transmigración eufemística. El centro de datos conservaría las particularidades del no lugar e incorporaría las connotaciones ecofriendly de un lugar, en cuanto generador de riqueza, virtualizado y plenamente integrado en los asimétricos flujos del capital financiero.

Por otra parte, a la hora de hablar de datos, habría que referirse casi de manera forzosa –sin negar posibles solapamientos– a un campo semántico que tiene en las ideas de archivo/memoria e información dos de sus principales pilares. Por supuesto, no voy a desarrollar una propuesta operativa de delimitación terminológica, pues son palabras cada vez más próximas en un mundo de datos masivos. Con todo, merece la pena subrayar que el archivo y la memoria parecen confluir en la actualidad, pese a sus sabidas diferencias. Grosso modo, mientras que el primero implica la valoración de lo consignado ante la posible pérdida, la memoria digital opera bajo el lema de un “por si acaso” escasamente selectivo o, mejor dicho, selectivo a partir de una lógica otra del archivo.

La capacidad potencialmente infinita de procesamiento y velocidad de recuperación de lo “archivado” provoca un desplazamiento de la responsabilidad: en vez de recaer en los eventuales arcontes, esta se presentaría tecnológicamente supeditada a la disponibilidad de un espacio “suficiente” y, en último término, a la obsolescencia programada. El paso del modelo cultural del archivo a otro marcado por la “memoria” de los dispositivos electrónicos supone, además, el debilitamiento de la conciencia interiorizada de ese archivo finito y, en cierto modo, la “depreciación” y pérdida de densidad temporal del objeto archivado. En consecuencia, la datificación generalizada nos obliga a cambiar la pregunta: no se trata (exclusivamente) de qué se archiva, sino más bien de cuánto espacio queda en la memoria y cuándo debería actualizarse o renovarse el dispositivo.

En principio, el devenir digital de las sociedades y la pujanza de los Big Data produce al menos dos diferencias fundamentales respecto a un modelo de archivo de datos “escasos”: la multiplicación de datos guardados de forma involuntaria y la pulsión de registro. Se desea guardar, transmitir, registrar, compartir constantemente; de ahí que estemos 24/7 produciendo datos más o menos estructurados o conocidos junto a una inmensa cantidad de “datos oscuros”. Según la consultora Gartner, autora de un glosario de información y tecnología, los Dark Data son “the information assets organizations collect, process and store during regular business activities, but generally fail to use for other purposes (for example, analytics, business relationships and direct monetizing)”[3]. Como si se tratara de un iceberg del que solo asomara un vértice diminuto, el océano del ciberespacio no permite contemplar las auténticas dimensiones –ni el coste energético– de los datos que se amontonan en servidores, memorias y centros de datos.

A mi entender, ese estado de inconsciencia aceptado, la ignorancia del funcionamiento del sistema, los Dark Data o la interesada invisibilización de las consecuencias de la infraestructura de los centros de datos son síntomas similares a los descritos por Rose George como “sea blindness”. En la introducción de Deep Sea and Foreing Going, George explica que este tipo de ceguera es la que experimenta el transporte marítimo, pues no recibe la misma crítica que otros sectores, aun cuando se trata del principal responsable del comercio exterior y una de las actividades que más dióxido de carbono emite a la atmósfera:

The sea is a distance to be flown over, a downward backdrop between take-off and landing, a blue expanse that soothes on the moving flight map as the plane jerks over. It is a leisure and beaches and fish and chips, not for use or work. Perhaps we believe that everything travels by air, or that is does so magically and instantaneously like information (which is actually transmitted by cables on the seabed), not by hefty ships (George, 2014).

Por esta razón, considero que podría ser especialmente útil incorporar al análisis el concepto de “data blindness”, un término que, por el momento, no ha salido del ámbito de las empresas de servicios digitales para referirse a una doble cuestión:

In the first definition, data blindness refers to having an abundance of data, unstructured with an overload of information preventing the user from leveraging data to find valuable information to make decisions. Data blindness could also mean having little or no visibility over data and organizations having no idea regarding how their businesses are functioning, leading them to make uninformed decisions that could be detrimental to their functioning (nytt, 2022).

En parte, las dos formas de ceguera reproducen de fondo el telos optimista de la ciencia moderna, ya que sería una miopía “corregible” tecnológicamente –acceso a más datos, mayor potencia de cálculo o mejoras en el aprendizaje automático– y, claro está, rentabilizable. No obstante, si tiramos un poco del hilo, se podrían distinguir otras experiencias de esta “ceguera de datos”, algunas más metafóricas y otras más técnicas y estructurales.

La “ceguera” más evidente sería el desconocimiento del rastro digital que deja voluntaria e involuntariamente nuestra vida online; además, habría que añadir la ignorancia de dónde se almacena esa información y qué/quién se hace con esos datos[4]. Otra posible arista del fenómeno se observa en la incomprensión no solo técnica –desactualización o situaciones de brecha digital y cognitiva, por mencionar un par de casos–, sino también la producida por la captura masiva de datos, que, incluso tras su tratamiento, permanecen “desactivados”. O planteado desde otro ángulo: un tipo de ceguera bien pudiera ser una versión “crítica” de las capacidades de los grandes datos; es decir, una reedición más sustanciosa de la dicotomía cuantitativo/cualitativo en tiempos de Big Data e IA.

Por otro lado, la acepción de data blindness más pertinente para este ensayo tiene que ver con la materialidad de los centros de datos como núcleo de una infraestructura digital que vive supuestamente en la nube. Como se ha venido analizando, resulta peligroso suscribir el discurso hipercapitalista sin detenerse mínimamente en aquellos colectivos, ecosistemas o territorios sacrificados. La velocidad o la conectividad se han vuelto valores en sí mismos y, por tanto, no precisan de ninguna justificación aparte de la maximización de beneficios. En este sentido, data blindness expresa un proceder cortoplacista e instrumental, que dificulta dar un paso atrás para observar el conjunto y las relaciones entre las partes. Un centro de datos sería, por definición y por coherencia con su diseño, una entidad tan opaca (no deja ver su interior) como ciega (incapaz de ver más allá). Como argumenta Kate Crawford, “la palabra ‘datos’ se ha vuelto aséptica: esconde la materialidad tanto de sus orígenes como de sus fines” (2023: 174).

Así pues, ante un panorama cada vez más determinado por los Big Data, la programación cuántica, los centros de datos o las criptomonedas, parece inevitable referirse al capitalismo gore, el afortunado concepto que Sayak Valencia acuñó precisamente para analizar el rostro y las consecuencias del Lado B del capitalismo “sin enmascaramientos” (2010: 18). Consumismo compulsivo de datos, la glotonería energética o el neoextractivismo de las industrias digitales son, quizá, las penúltimas muestras del régimen necropolítico hipercapitalista y de unas prácticas consumistas gore, que evaden “el juicio moral para ser interpretadas como pertinentes bajo los criterios de la teoría económica” (Valencia, 2010: 60-61). Por tanto, advertir la ceguera de datos personal y estructural supondría, en mi opinión, ir más allá del imperativo tecnológico y de la literalidad de la sintaxis legislativa con el objetivo de aprender a leer(nos), en términos de Jane Bennett, como “materia vibrante” (2022).

Referencias bibliográficas

Bennett, J. (2022). Materia vibrante. Una ecología política de las cosas, Caja Negra Editora.

Crawford, K. (2023). Atlas de IA, Ned Ediciones.

Farfan, J. y Lohrman, A. (2023). “Gone with the clouds: Estimating the electricity and water footprint of digital data services in Europe”, Energy Conversion and Management, 290. Disponible en https://doi.org/10.1016/j.enconman.2023.117225.

Gámez Cersosimo, P. (2021). Depredadores digitales. Una historia de la huella de carbono de la industria digital, Editorial Círculo Rojo.

Geng, H. (2021). “Sustainable Data Center: Strategic Planning, Design, Construction, and Operations with Emerging Technologies”, en Data Center Handbook: Plan, Design, Build, and Operations of a Smart Data Center, Wiley, 1-14.

George, R. (2014). Deep Sea and Foreign Going: Inside Shipping, the Invisible Industry that Brings You 90% of Everything, Granta Books.

Hand, D. J. (2020). Dark Data. Why what you don’t know matters, Princeton University Press.

Lei, N. y Masanet, E. R. (2021). “Global Data Center Energy Demand and Strategies to Conserve Energy”, en Data Center Handbook: Plan, Design, Build, and Operations of a Smart Data Center, H. Geng (ed.), Wiley, 15-26.

Ludmer, J. (2010). Aquí América Latina. Una especulación, Eterna Cadencia.

NYTT (2022). “Data blindness: A contranym affecting data-driven decision making”. Disponible en https://nytt-tech.com/blogs/data-blindness.html.

Valencia, S. (2010). Capitalismo gore, Melusina.

[1] Este texto es una versión revisada y reducida de mi trabajo “Greenwashing data en tiempos insostenibles: algunas ideas sobre ecoimposturas, centros de datos y data blindness”, publicado en J. C. Ángel-Reyes y J. Buj (coords.), Cultura digital y construcción de paisajes narrativos. Conexiones-discontinuidades, Fundación Telefónica-Taurus-Universidad Iberoamericana, 2024, 165-197.

[2] De acuerdo con Water Footprint Network (https://www.waterfootprint.org/), la huella de agua supone “a measure of humanity’s appropriation of fresh water in volumes of water consumed and/or polluted […]. The water footprint looks at both direct and indirect water use of a process, product, company or sector and includes water consumption and pollution throughout the full production cycle from the supply chain to the end-user”. La web incluye una Personal water footprint calculator del estilo de vida. En sus funciones más básicas, las variables que considera son el país de residencia, el género, la dieta y los ingresos anuales.

[3] Pablo Gámez aventura en Depredadores digitales que “un promedio del 52% de los datos almacenados por las empresas en todo el mundo se consideran oscuros, ya que quienes los administran no son conscientes de su contenido o valor” (2021: 25).

[4] En los últimos años aparecieron empresas que vieron una oportunidad de negocio en el borrado del rastro digital. Desde otro punto de vista, la Lista Robinson está pensada para limitar el acceso a los datos por parte de las empresas ante el acoso publicitario. No obstante, convendría reflexionar sobre la efectividad de estas iniciativas en un ciberespacio cada vez más monitoreado por las cookies.

“Al estudiante, hay que proporcionarle herramientas para que sea capaz de detectar sesgos”. Entrevista con Xavier Agenjo Bullón, por Amelia Sanz y Johanna Vollmeyer

Xavier Agenjo Bullón (Madrid, 1955) es miembro del Cuerpo Facultativo de Bibliotecarios, Archiveros y Arqueólogos. Fue jefe del Servicio del Catálogo Colectivo de Patrimonio Bibliográfico, jefe de la Unidad de Coordinación Informática y del departamento de Acceso al Documento de la Biblioteca Nacional, director de la Biblioteca de Menéndez Pelayo y desde 2002 es director de Proyectos de la Fundación Larramendi.

LEETHI: Estamos con Javier Agenjo Bullón y esta es nuestra segunda entrevista a grandes bibliotecarios y archivistas que participaron desde los primeros años en los procesos de digitalización de las bibliotecas y archivos. Nos importa mucho su experiencia y, después de haber leído dos de sus artículos, “La digitalización de materiales bibliotecarios en la Biblioteca Nacional” (1995) y el “Informe sobre la digitalización del patrimonio bibliográfico en España” (2025), nos gustaría conocer la esencia de esos 30 años de experiencia.

Consejo de Cooperación Bibliotecaria (2025) Informe sobre la digitalización del patrimonio bibliográfico en España

Sabemos por su trayectoria que proporcionar acceso a la información es clave para usted. Y en este contexto queremos empezar por el final y preguntar por los desarrollos más recientes que se están aplicando en bibliotecas y archivos: la inteligencia artificial para la búsqueda de información. Usted se ha pronunciado de manera muy favorable sobre la IA considerándola capaz de compilar y luego narrar de manera muy coherente incluso información compleja, adaptada al perfil del usuario. ¿Por qué cree que la aplicación de la IA podría facilitar un acceso incluso más amplio a los usuarios y usuarias y cómo?

Xavier Agenjo Bullón: Exactamente, estoy convencido de que la IA es capaz de ofrecer al lector información mucho más completa. En muchas bibliotecas, como la Biblioteca Nacional, ya no hay nadie en las salas de lectura. Y eso es una buena señal porque mucha información para la que antes tenías que ir a la BNE para consultar en los libros o en periódicos está ahora en la web. Por lo tanto, hay que estar muy contentos de que hayamos digitalizado esta información y que ahora esté accesible en la web.

Les voy a contar una anécdota al respecto: un día yo compilé una bibliografía del abuelo de Ignacio Hernando de Larramendi (el fundador de Mapfre y de la Fundación Ignacio Larramendi). Hice un estudio muy completo y me preguntaron asombrados: “¿De dónde has sacado toda esta información?”. Y de esto se trata precisamente: no todo el mundo tiene un archivero a su disposición para prestar este servicio. Sin embargo, con la IA esto será posible. Por eso, en mi opinión los archivos tienen que ser capaces no de dar una respuesta única al lector, sino de disponer de las herramientas –en este caso la IA– para reunir información de diferentes fuentes y presentar este conjunto al lector porque él no va a recopilar todo ello.

Además, hay que tener en cuenta que la gente tiene tendencia a hacer el mínimo esfuerzo. En este sentido, el escritor T. S. Eliot dice en Tradition and the Individual Talent (1919) que hay que intentar satisfacer este mínimo esfuerzo, en este caso del usuario. La gente no va a consultar una fuente en un lado y luego ir a otro para consultar un manuscrito que está en un archivo perdido y, además, está en letra procesal que es muy difícil de leer y en latín, y en un latín malo. La mayoría de los usuarios no va a hacer el esfuerzo para descifrar todo esto.

LEETHI: Entendemos la relevancia de la IA en el contexto de los archivos. Pero también nos surgen varias preguntas críticas al respecto. Por ejemplo: ¿cómo se decide qué se digitaliza?, ¿qué es lo que no se digitaliza?, ¿de qué forma se digitaliza el contenido? Según las encuestas del observatorio ENUMERATE en 2015 apenas el 10% del patrimonio europeo está digitalizado.

A esto hay que añadir que la IA también tiene sus propios sesgos. Además, con la IA las fuentes -tan importantes para los archiveros- pierden su trazabilidad porque directamente no se presentan esas fuentes exactas a los/las usuarios/as, sino un resumen sintetizado. Sin embargo, para nosotras, como investigadoras, estas fuentes iniciales son especialmente relevantes.

Una persona tan experta y formada como usted sabe distinguir perfectamente si la información presentada por una IA es fiable e, incluso, cuáles pueden ser las fuentes. Pero las generaciones venideras no disponen de este bagaje. De hecho, lo estamos observando ya en las universidades con nuestro estudiantado. Esto quiere decir nada menos que ahí reside el potencial peligro de reescribir la historia a partir de una selección de un patrimonio o, mejor dicho, de una selección digital de un patrimonio sin fuentes trazables. ¿Usted y otros archiveros se dan cuenta de este peligro? ¿Hay un debate sobre este desarrollo entre los archiveros?

Xavier Agenjo Bullón: Tienen ustedes razón, aunque esto no es nada nuevo. Ya lo comenta Eric Hobsbawm en una de sus publicaciones donde habla de la “tradición inventada” en 1983. Les voy a dar un ejemplo muy claro: a la antigua Plaza de Vázquez de Mella, que fue un político, escritor y filósofo muy de izquierdas y que luego se hizo carlista, le han puesto ahora el nombre de Pedro Zerolo, que fue miembro del PSOE y del movimiento LGTBQ+. Otro ejemplo: Antonio de Bofarull, archivero en el Archivo de Aragón que, como era muy nacionalista, empezó a quitar cosas que iban en contra de su historia[1].

Creo que la conciencia de los sesgos es una parte muy importante de nuestra profesión. Ya lo comenta John Elliott en su libro Haciendo Historia (2012): las fuentes pueden ser muy buenas, incluso fenomenales, pero representan siempre un sesgo total. Por ejemplo, las fuentes de la CIA son casi todas americanas, así que te transmiten una Weltanschauung [cosmovisión] muy determinada. Date cuenta de que ellos meten mucho más dinero en Hollywood que cualquier otro, con lo cual la cosmovisión de Hollywood está totalmente influenciada por ello.

Entonces, frente a ese paradigma cognitivo e identitario ¿qué hacemos? No hay respuesta fácil. Como decía Schiller, (citado por John Rawls y Jürgen Habermas en Debate sobre el liberalismo político (1995)), además de las técnicas y metodologías que tiene que estudiar un filólogo o un historiador, lo que tiene que hacer es dedicar mucho tiempo para acceder a las fuentes originales. Y luego tratarlas de manera crítica. Roland Barthes incide mucho en ello cuando resalta que el lenguaje que empleas puede llegar a ser fascista. Porque estás utilizando unas palabras cargadas de historia. Es decir: “cuidado con las fuentes”.

Quizá el mayor problema que puede tener una facultad de Filología o de Historia es documental. Claro que es difícil enseñarle a un niño de 17 años lo que dice Kant y hay que prepararlo para que lo entienda. Pero hay que ser transparente y enseñarle también que toda información proporcionada durante su carrera está muy sesgada. Por eso hay que proporcionarle herramientas para que sea capaz de detectar esos sesgos. Quiere decir que en los primeros años sería preciso insistir justamente en la metodología.

LEETHI: Respecto a la digitalización y al desarrollo de la IA, ¿cuáles serían en su opinión responsabilidades de los archivos y cuáles de los investigadores?

Xavier Agenjo Bullón: Leí hace muchísimos años sobre el debate entre John Rawls y Jürgen Habermas. En él plantean qué sucede cuando pasas de un sistema antiguo a uno nuevo. Es precisamente lo que estamos viviendo en estos momentos con la web semántica. Yo personalmente tengo muchísima fe en la inteligencia artificial. A pesar de que, como bien han señalado, conlleva muchísimos peligros porque puede generar información muy sesgada. Esos sesgos están muy vinculados a los idiomas más representados en las IA. Lenguas como el español son muy fuertes, pero realmente solo hay diez lenguas que están bien representadas: español, portugués, francés, inglés, ruso, urdu, hindi, chino y árabe. Si os fijáis, de esas lenguas ocho son indoeuropeas, lo cual es un sesgo lingüístico total. Lamentablemente no es posible que una IA conteste bien en cada una de las casi 8000 lenguas que hay en el mundo. Este sesgo lingüístico es lo más evidente.

Por eso es muy importante tener una buena propedéutica en las universidades porque los bibliotecarios no saben nada de estos sesgos, ni se lo plantean.

LEETHI: Efectivamente, uno de los asuntos que nos asombra es la creencia en la transparencia o en la neutralidad que tienen los bibliotecarios y los archiveros cuando ni son neutrales ni transparentes. Sin embargo, cada vez que mencionamos el problema de esta supuesta neutralidad nos miran con asombro y nos queda claro que no han leído su Michel Foucault, ni su Eliott, ni su Wittgenstein.

Xavier Agenjo Bullón: Es más: si se lo dices se enfadan. Lo mismo les sucede cuando escogen herramientas de trabajo, por ejemplo, para catalogar obras. Se les presenta una herramienta que les permite catalogar cien obras en veinte horas en vez de tardar una semana, como hasta ahora, solo por eso la escogen. Pero cuando vas a comprar un pantalón, no te lo quedas solo por el color, sino que lo miras más de cerca para ver si, por ejemplo, luego encoge o no encoge.

La Biblioteca Nacional en los primeros años no era capaz de catalogar toda la producción nacional y empezó a contratar empresas para ello. No sé si han observado que muchísimas entradas están cogidas por la OCLC (Online Computer Library Center). Evidentemente desde un punto de vista económico es maravilloso tener todo en un catálogo. Pero mucha información ha entrado en el catálogo solo por este filtro, en vez de trabajar catálogos propios. Lo mismo sucede con la Biblioteca de la Universidad Complutense: sus registros vienen con un sesgo. Muchas veces me llevo las manos a la cabeza porque toda esta catalogación se ha hecho en EE. UU., según sus criterios.

LEETHI: Entonces, hablamos aquí tanto de una cuestión de pérdida de soberanía nacional sobre el patrimonio, como de la introducción de determinados sesgos, digamos “transnacionales”.

En su artículo sobre BigFrame habla precisamente de una iniciativa colectiva, del sueño de un único punto de entrada para todas las bibliotecas españolas. ¿Lo considera como un logro imprescindible a conseguir? ¿Y hay otros sueños suyos incumplidos?

Xavier Agenjo Bullón: Así es. Pero, además, echo en falta otra cosa muy importante: cuando empecé a trabajar en la automatización, hablaba con los informáticos sobre las cosas que tenía en mente. Su departamento tenía un nombre que me encantaba: “informática y organización”. Es precisamente esto lo que ahora echo en falta: más organización. Sería necesario convocar jornadas formativas sobre Hispana, por ejemplo, cada tres años como mínimo, o vía teleconferencia para estar al día.

LEETHI: Eso concierne también a los órganos políticos. Es decir, parece que en un determinado momento hubo una conciencia política de la necesidad de digitalización y de organizar todo este proceso y ahora ¿cree que falta esa visión?

Xavier Agenjo Bullón: Sí, totalmente. Y añadiría que falta el conocimiento de la normativa. Hace falta mucho más conocimiento de ello. Los españoles se deben involucrar muchísimo más en organismos donde se toman decisiones importantes sobre la normativa, porque yo veo las reuniones que se hacen en Europeana a nivel internacional y pocas veces hay españoles involucrados. ¿Por qué no hay personas en el diseño y desarrollo de inteligencia artificial en este ámbito? Así que echo en falta más participación de bibliotecarios en las comisiones de grandes organismos. Echo en falta más visión.

Y eso no siempre ha sido así. Estuve como director de la Biblioteca de Menéndez Pelayo en Santander. Pero después de la muerte de Ignacio Larramendi, sus hijos me trajeron a Madrid para trabajar en un nuevo proyecto que consistía en realizar aquella idea de Menéndez Pelayo de crear una biblioteca de grandes pensadores y creamos una biblioteca virtual con un programa nuevo.

Luego este programa lo han comprado casi todas las Comunidades Autónomas de España, desde Galicia, pasando por el propio Ministerio de Cultura, hasta Cataluña, la Biblioteca Virtual de Andalucía y nuestra propia Biblioteca Virtual. Me fijé mucho en el modelo de datos porque en ese momento se desarrolló un nuevo concepto de Internet que era la web semántica, donde en vez de enlazar información a través de URLs era a través de URIs, un tipo de enlaces más avanzados. Este momento coincidió con el proyecto Google Books que hizo Marta Torres y se vio en él mucho peligro de que el patrimonio europeo pasara a manos de los “yankees”. Entonces, pensamos en dar una respuesta a Google Books y nació la Biblioteca Virtual de la Unión Europea que después se llamó Europeana.

Y allí me di cuenta de la importancia de que los datos estuvieran entrelazados con otros nombres de autores y con la materia relacionada. A raíz de ello se creó un estándar que se llama RDF para describir recursos y sus relaciones de forma estructurada y legible por máquinas, fundamental para la web semántica y de los datos enlazados. Al mismo tiempo en España se empezó a hacer un proyecto –en colaboración con Digibís que salió también de Larramendi– que es Hispana: un agregador de metadatos, un programa que hemos desarrollado nosotros y que a día de hoy engloba 250 instituciones de toda España.

LEETHI: Eso nos lleva a un balance final. Porque ahora hay 250 instituciones en Hispana, pero muchas otras no están. Y nos interesa el estado de los archivos y bibliotecas en España. ¿Qué cambios estructurales o normativos deberían ser imprescindibles hoy para avanzar?

Xavier Ajenjo Bullón: Habría que hacer más hincapié en congresos, publicaciones, encuentros para contar todas estas cosas, porque a veces pienso que no es lo suficientemente conocido. Yo creo que allí hay una labor grande: porque si haces bien el trabajo siguiendo los estándares que marcan Hispana o Europeana vas a ganar una visibilidad muy importante.

LEETHI: Pero para esto hace falta mucho dinero y mucha formación para los bibliotecarios.

Xavier Ajenjo Bullón: Yo creo que no, formación tampoco demasiada. Con pequeños cursos, conferencias, cursillos de capacitación sería suficiente y para ello no hace falta demasiado dinero. Además, una parte la paga el Ministerio y otra parte la paga la Comunidad Autónoma según la Ley de 1984 del Patrimonio de España, que da competencias a las Comunidades Autónomas.

Hay tres o cuatro cosas más que son muy importantes y donde quiero hacer muchísimo hincapié. Una, en la que de momento hay poco avance, y que es sustituir el formato MARC por un nuevo estándar de codificación. En su día los pioneros utilizaban el formato MARC para todo. Ahora hay un nuevo proyecto para desarrollar un formato que se llama Biframe. Bibframe es una forma de codificación de los materiales bibliográficos que está sustituyendo al formato MARC, implementado en todo el mundo desde los años 60, sobre todo en EE. UU. y en Europa, pero también en Corea, Japón… Recientemente Suecia ha migrado todas sus bibliotecas del formato MARC a Bibframe. Llevo más de diez años publicando artículos para detallar el estado de la cuestión, a ver si alguna biblioteca española se anima. Muy recientemente he tenido una primera reunión con la empresa Baratz para intentar implementar Bibframe en España. Además, estaré en otra reunión que se va a celebrar en Barcelona en septiembre de este año. Por supuesto nuestra Biblioteca Virtual de Polígrafos sería la primera que lo implementara. Pero veo que en otros lugares va avanzando mucho más que aquí y España se queda atrás.

La segunda sería crear una web semántica y vincular tanto lo que hace Europeana, como OAISTER. Es decir, no vincular un registro bibliográfico con otro registro bibliográfico, sino vincular esos registros con lo que no es el mundo bibliográfico; por ejemplo, conectar un registro con la Wikipedia o con el Diccionario de la RAE. Es decir, no hacer que el mundo bibliotecario se conecte solo entre sí –que es también muy importante–, sino que se conecte con otras cosas que existen.

El tercer punto: los bibliotecarios dicen que está muy bien que se conecte tal autor con Wikipedia. Para eso hace falta una técnica que es el enriquecimiento semántico. Y hay un sistema que se llama Open Refine: tu coges 100.000 autores y esta técnica hace que esos 100.000 autores se alineen con Wikipedia o con el Fichero de Autoridades en España, al tiempo que esos registros se alinean con el de los franceses, el de los alemanes, el de los ingleses. Y puedo utilizar enriquecimientos semánticos. Es más: las materias están en español, catalán, o en alemán, inglés, francés.

Y la cuarta es la utilización de las técnicas de inteligencia artificial que hemos debatido antes, por ejemplo, con técnicas de OCR para manuscritos; o un sistema como Gemini que te aporta información fuera de fuentes de información bibliográfica.

Toda esa información que tendrá la IA servirá a la gente. Sin ir más lejos, ahora mismo estamos desarrollando un proyecto maravilloso que es pasar aquello que era el proyecto ADMYTE a Philobiblon. Es la base de datos más grande de manuscritos medievales tanto gallegos, como portugueses, castellanos, catalanes y valencianos. Este proyecto se está implementando actualmente en la Universidad de Jena y se encuentra en un estado muy avanzado, aunque aún no concluido.

Y Europeana acaba de sacar un programa para aplicar inteligencia artificial en múltiples lenguas.

LEETHI: No queremos terminar sin volver a los orígenes, a lo que ha sido su carrera hasta llegar aquí: ¿cuándo decidió ser bibliotecario y cuándo se dio cuenta de que el futuro de las bibliotecas sería digital o no sería?

Xavier Agenjo Bullón: En mi familia había muchísimos bibliotecarios. De hecho, mi bisabuelo fue bibliotecario, en el año 1868 en el Cuerpo facultativo de Archiveros, Bibliotecarios y Arqueólogos que se creó en 1858. Eran los años de la terrible desamortización para el patrimonio cultural español; entonces se creó el cuerpo y diez años después a mi bisabuelo le nombraron funcionario. Se llamaba Agustín Bullón. Luego le siguió Eloy Bullón que fue también bibliotecario al lado de Menéndez Pelayo, cuando él vivía en la Real Academia de la Historia. Eloy Bullón fue el bibliotecario de esa institución. En la siguiente generación había otra bibliotecaria, mi tía, Caridad Bullón, que trabajó en la Universidad Complutense de Madrid, en la Facultad de Derecho. Con lo cual la posibilidad de ser bibliotecario me parecía muy normal.

Mi padre, por otro lado, era científico, entomólogo, y publicaba muchísimos artículos sobre entomología. Entonces para mí era habitual ver a mi padre escribir artículos de entomología y cuando entré en Bachillerato me dijo: “Bueno, tú ya eres mayor para ayudarme a corregir” –no solamente sus artículos, sino las dos revistas que había de entomología y de ciencias naturales en Madrid–. Entonces empecé a hacer correcciones de las referencias bibliográficas, en alemán e italiano, y eso me gustaba mucho.

Luego realicé el curso de bibliotecarios en la Escuela de Bibliotecarios. Me presenté al grupo facultativo y empecé a trabajar en la Biblioteca Nacional. Durante mi formación conocí a Camarero que ya entonces empezó a hablar de la codificación de los registros bibliográficos y me gustó mucho la idea, porque antes había estudiado matemáticas, aunque no acabé esa carrera.

Entonces en la Biblioteca Nacional se empezó a trabajar el Catálogo de Patrimonio Bibliográfico. Cuando estuve allí como jefe de servicio, empecé a codificar la información de todas las Comunidades Autónomas: comencé la automatización de bibliotecas. Se hizo de una forma muy especial: la gente escribía en unos folios la codificación, eso se mandaba a una empresa que transformaba los datos en unas cintas y luego se mandaba esta información a los puntos de información cultural que tenía el Ministerio de Cultura. Fue en los años 80 y aquello funcionó. Lo presentamos[2] en mayo del 1987 en el Congreso Nacional de Bibliotecarios, Archivistas e Documentalistas celebrado en Coimbra, Portugal[3], y nos conectamos –no por internet sino con X.25– y ¡funcionó! Decían que era maravilloso.

Portada del Catálogo Colectivo del Patrimonio Bibliográfico (España)

Claro, cuando vino la web en 1986, dijeron que había que realizar la automatización de la Biblioteca Nacional de España. Había que hacerlo con un programa, pero no había programa, así que trabajé con unos informáticos más jóvenes que yo, a partir del formato Marc y aquello funcionó: fue el proyecto Ariadna en los años 1989-1991.

Yo leía mucha información, sobre todo americana (las directrices de la Library of Congress), y pensaba que era muy importante el control de autoridades, sobre todo para una biblioteca nacional, aunque en aquella época se daba la mayor importancia a la descripción bibliográfica. De hecho, publiqué un artículo sobre el control de autoridades[4].

Como yo había trabajado en catálogos de patrimonio antiguo, consideraba muy importante la información sobre los ejemplares, su estado, si se había anotado algo o no: Ariadna lo tenía todo y eso en 1994 era algo muy nuevo, estaba muy avanzado.

En esa época se automatizaron otros archivos, sobre todo el Archivo General de Indias. Se invirtió muchísimo dinero. Es verdad que había poca experiencia, no solo en España sino a nivel mundial, en temas de automatización, pero se cometieron algunos errores sobre todo desde el punto de vista de los estándares: no tuvieron en cuenta las normas ISO disponibles.

Por entonces conocí al presidente de Mapfre, Ignacio Larramendi, de quien me hice muy amigo y entonces pasé a ser miembro del Patronato de la Fundación Larramendi, porque Larramendi estaba interesado en la automatización de archivos y empecé a trabajar en este proyecto de fondos que se llama ADMYTE y con el que sigo colaborando, hoy con técnicas muy avanzadas.

Una cosa muy curiosa es que empezó la gente a ir a la Biblioteca Nacional a pedir información ligada a su apellido. ¡Había que empezar a digitalizar los documentos sobre apellidos! Entonces entendí lo importante que era estar muy pendiente de que la digitalización de fondos fuera una respuesta a la necesidad de los lectores. Fue un paso muy grande.

Poco a poco empecé a tener más gente a mi cargo. Al final pasé a ser Director del Departamento de Automatización de la Red Nacional que es como se llamaba la unidad de coordinación informática, esto es director de acceso a la información y al documento. Tuve a mi cargo más de 200 personas, pero aquello no me gustó nada. Me pasaba el día discutiendo con la gente, con los jefes de servicio. Sin embargo, sí empezamos la digitalización de fondos que era una cosa muy nueva y hoy en día poco contada. Empezamos con la robotización de los depósitos de Alcalá, que es donde se llevan los ejemplares de una publicación. Uno se queda en el Paseo de Recoletos y los demás van a Alcalá. Ahí hay unos inmensos edificios muy poco conocidos y se instalaron allí unos robots. De hecho, leí una vez un artículo de Rosa Montero que hablaba de ellos, de los robots en la biblioteca. Los depósitos de Alcalá tienen nueve pisos y con jaulas entre planta y planta. Mantener todo esto cuesta una barbaridad. Por eso es mucho más barato trabajar allí con robots. Es el robot el que coge entre los libros, los va poniendo por aquí, para allá.

Y me acuerdo cuando fue el congreso internacional de la IFLA en 1993 que lo convoca la asociación de bibliotecarios de todo el mundo. Tuvo lugar en Barcelona, pero también se hizo una parte en Madrid y entonces empecé a hablar de los robots. Pensaban que era broma, pero alquilé un autobús, los llevé allí y se quedaron asombrados.

Pero volvamos a mi historia: como dije era jefe de personal, pero no me gustaba la cosa. Entonces me fui a Santander como director de la Biblioteca de Menéndez Pelayo. Pelayo había cedido su casa –que es muy bonita– y su biblioteca muy buena, pero con la condición de contratar a un bibliotecario facultativo que supiera los idiomas antiguos –latín, griego– y que supiera dos lenguas extranjeras a parte del francés, o sea, por lo menos tres lenguas.

En Santander empecé un proyecto y dado que Menéndez Pedayo había hecho una bibliografía sobre la Historia de los heterodoxos españoles, lo primero que hice fue automatizar todas estas fuentes de información, toda esa gran bibliografía que son ediciones de Menéndez Pelayo y así dar más acceso a los mismos textos. Mapfre y su fundación nos ayudaron a hacer la automatización en base de la codificación en HTML en 1997/98.

El programa, que se llama Digihub, se vendió luego a otras instituciones españolas y a Hispana, que a día de hoy creo tiene 13 o 14 millones de objetos digitales de 250 instituciones. Digihub es un agregador de metadatos que recoge los metadatos de diferentes instituciones y a su vez es recolectado por Europeana. En Alemania lo copiaron para la Deutsche Digitale Bibliothek. Usan el protocolo europeo OAI-PMH (Open Archives Initiative Protocol for Metadata Harvesting) y no OAISTER que es el protocolo estadounidense. Es genial porque das de alta un registro en tu biblioteca y pasa automáticamente a Hispana, Europeana y otros archivos internacionales, incluso se puede pasar al agregador que usan los americanos y la información se vuelca automáticamente a su catálogo colectivo. Y así la información es más accesible.

LEETHI: Le agradecemos que comparta con nosotras estas experiencias. Veremos qué avances nos deparará el futuro y estaríamos encantadas en comentarlos con usted en otra ocasión.

[1] Julio Martín Alarcón: “El archivero catalán que manipuló los documentos de la Edad Media | La Aventura de la Historia”, en El Mundo, 21/09/2015.

[2] Carlos Ruiz, Xavier Agenjo Bullón (1990): “La automatización de la Biblioteca Nacional”, Item: Revista de biblioteconomia i documentació, Nº. 6-7 (Gener-desembre), 1990, 55-68.

[3] Congresso Nacional de Bibliotecários, Arquivistas e Documentalistas, 2, Coimbra, 1987 – A integração Europeia: um desafio à informação. Actas. Editado Livraria Minerva.

[4] Xavier Agenjo BullónPilar Palá Gasós (1987): “El fichero de autoridades del Catálogo Colectivo del Patrimonio Bibliográfico”, en: Boletín de la ANABAD, 37 (4), 593-606.

“Los archivos son nuestra garantía de derechos”: Entrevista con Esther Cruces (4/11/2025) por Johanna Vollmeyer y Amelia Sanz

“Los archivos son nuestra garantía de derechos”: Entrevista con Esther Cruces (4/11/2025) por Johanna Vollmeyer y Amelia Sanz (Grupo LEETHI)

Abrimos una serie de entrevistas que llamamos Promesas (in)cumplidas de la digitalización de los archivos y bibliotecas, a manera de balance de estos procesos en los últimos 30 años en España. Queremos entender mejor la función y funcionamiento de los archivos tradicionales para analizar el alcance de su digitalización desde el punto de vista de los estudios de la memoria. Confluyen, pues, digitalización y memoria: cómo creamos memoria y qué papel juegan los archivos en este proceso, cómo afecta la digitalización tanto al archivo mismo como a la creación de memoria. Esta es nuestra primera entrevista a una archivera de lujo como es Esther Cruces[1] que ha dirigido el Archivo General de Indias y posee pues una larga experiencia en la digitalización de los archivos desde sus comienzos.

SEVILLA Börse (Lonja) / von Juan de Herrera, 1572 / heute Archiv von Westindien. / 73, https://rs.cms.hu-berlin.de/ikb_mediathek/pages/view.php?ref=5895; Media library of Art and Visual History of Humboldt University of Berlin; https://www.europeana.eu/es/item/626/item_JTETGSRDOJ2AWKQIPEABTQHCGBMJWXEQ?page=1

SEVILLA Börse (Lonja) / von Juan de Herrera, 1572 / heute Archiv von Westindien (Mediathek Humboldt Universität) Europeana.eu

LEETHI: La primera pregunta que nos gustaría plantear se refiere a la historia de la digitalización del Archivo General de Indias que empezó con una colaboración entre IBM España, la Fundación Ramón Areces y el Ministerio de Cultura. ¿Cómo se desarrolló concretamente?

Esther Cruces: Debido a los muchos años de ejercicio de la profesión, me hace mucha ilusión hablar de aquel proyecto que se llamaba “Informatización del Archivo General de Indias” que empezó en 1986. Y me hace ilusión porque yo era directora de un archivo histórico provincial, el de Córdoba, muy jovencita, y el ministro de Cultura en aquel momento, Javier Solana invitó a un grupo de archiveros, que nada teníamos que ver con la informatización —que así se llamaba entonces— ni con el Archivo General de Indias, para mostrarnos el proyecto. A mí se me abrió un mundo que yo creía era de ciencia ficción, porque el cometido como directora de un archivo era la microfilmación. Entonces microfilmar era una cuestión de archivos de élite, de aquellos que contaban con presupuesto para ello.

Para llevar a cabo estos proyectos de “informatización”, hacen falta tres cosas: 1) personal especializado a todos los niveles y de distintas profesiones, 2) muchas inversiones, es decir presupuesto, y 3) una cuestión que casi todo el mundo omite y es que los archivos tienen que estar preparados para ello, es decir deben tener los niveles suficientes de descripción de la documentación, de organización. Si se digitaliza sin unas técnicas previas formuladas por la Archivística, existirán dos problemas: 1) no se va a encontrar el documento original nunca y 2) tampoco será encontrado el objeto digital, la imagen.

Aquel proyecto surgió en el seno de lo que era la organización de la “Exposición Universal de Sevilla” de 1992. Me enorgullece que aquellas personas que estuvieron iniciando este proyecto, entre ellos la archivera Margarita Vázquez de Parga quien en aquel momento era la Subdirectora de los Archivos Estatales, tuvieran, primero, una visión de futuro y, luego, la habilidad de introducir una inversión enorme en un archivo, cuando en la España de esos momentos se pensaba en obras de infraestructuras como el AVE, la autovía que vertebró Andalucía, o la estación de ferrocarril de Sevilla. Aún hoy me alegra que alguien tuviera la sensibilidad de acordarse del Archivo General de Indias, pues el proyecto se convirtió en una referencia institucional a partir de 1992. Fue una gran suerte que en toda esa vorágine de construcción y de proyección de infraestructuras alguien supiera introducir el Archivo General de Indias y sus documentos en el desarrollo de lo relativo a la Exposición Universal.

En aquel momento se concitaron tres mundos distintos: el Ministerio de Cultura, titular del Archivo General de Indias (y responsable de los bienes del Estado, en este caso, del patrimonio documental); un mecenas, la Fundación Ramón Areces (El Corte Inglés) y una empresa, IBM España. Recuerdo que hubo críticas, porque se decía que España estaba vendiendo a una multinacional su patrimonio; no se puede entender el proyecto de “Informatización del Archivo General de Indias” como una cesión, pues las contrapartidas se basaron en la experimentación y en la investigación de IBM España y de IBM Internacional que utilizaría la herramienta que en el Archivo pudiera desarrollar. No se vendió el patrimonio documental y el proyecto fue relevante porque tuvo una implicación y un desarrollo posterior no solamente en el Archivo General de Indias, sino en todos los archivos estatales españoles. En aquel momento creo que el Proyecto fue una proeza; los medios de comunicación y la literatura profesional entendieron que fue “un hito”, “un laboratorio”, “un reto extraordinario”, “un proyecto piloto”. Organismos internacionales, como el Consejo Internacional de Archivos y la UNESCO lo valoraron muchísimo, incluso acudieron durante todo el desarrollo del proyecto al Archivo General de Indias para analizarlo. De ello quedan testimonios técnicos e incluso un informe RAMP (Records and Archives Management Programme) de la UNESCO que ha sido una referencia con respecto a la informatización, como apuntaba ya Christopher Kitching en 1991.

LEETHI: ¿En qué consistió el primer paso?

E. Cruces: El primer paso fue establecer un acuerdo de mecenazgo y la cobertura jurídica y administrativa entre las tres partes: tres instituciones que prestan su aportación económica y la colaboración de sus especialistas para desarrollar un sistema de informatización integrado, considerando las diferentes funciones del Archivo General de Indias. Quiere decir que detrás de todo hubo un proyecto integral que se desglosó en distintos subsistemas de trabajo: el propio de la gestión, y aquí me refiero a la gestión documental; el subsistema de información y referencias; y el subsistema de almacenamiento digital de las imágenes. El proyecto se estableció para el periodo 1986 a 1992 con 1000 millones de pesetas, que no era poco, hubo de ser ampliado al período 1993-1994 para que tuviera unos resultados realmente tangibles al que se destinaron otros 300 millones. Yo no sé si hoy se podría abordar algo semejante.

LEETHI: Una vez llegados a este acuerdo, ¿por dónde empezaron? ¿Cuáles fueron los primeros criterios de selección?

E. Cruces: En ese momento yo era directora de otro archivo en Sevilla (el Archivo General de Andalucía), y tuve la suerte de tener una estrecha relación tanto con Rosario Parra Cala, directora del Archivo General de Indias en aquel entonces, como con Pedro González García, director de esta institución archivística posteriormente, de manera que tuve la oportunidad de que me mostraran el desarrollo del Proyecto. Este Proyecto desde su propio planteamiento establece los criterios de selección de documentos para informatizar y digitalizar. Es la pregunta clave, lo fue entonces y lo es hoy: ¿qué se selecciona cuando los recursos son escasos? y además en relación con la reproducción de documentos se ha de ser consciente de que no se puede abordar todo. El criterio que desde los archivos siempre se pondrá sobre la mesa es que la reproducción, la digitalización, ha de contribuir, en primer lugar, a la preservación del patrimonio documental porque estas acciones evitan la manipulación, el deterioro, los posibles robos. La segunda premisa, ayer y hoy, es que se deben digitalizar series completas de documentos; esta forma de actuar rompe con una idea imperante tal vez basada en el trabajo de otras instituciones, como los museos y la elaboración de objetos digitales en ellos conservados. En los archivos no se deben seleccionar documentos sueltos, individuales, aunque en el Archivo General de Indias, como todo archivo, pueden existir piezas “estelares”. Otro criterio esencial del Proyecto era el de buscar la mayor utilidad posible para la consulta de los potenciales usuarios, para ello se hicieron análisis con el fin de ver qué series documentales podían ser las más demandadas teniendo en cuenta que en aquel momento las consultas eran casi exclusivamente presenciales en lo que se denominaba la sala de investigadores. Otro criterio que se conjugó para establecer la documentación que debía formar parte del proyecto fue el relativo al ámbito geográfico de los documentos, considerando cubrir todos los territorios relacionados con la presencia de la monarquía hispánica en América y en Filipinas. Y, por último, algo fundamental, fue el estado de descripción de los documentos, es decir un criterio muy práctico sobre el trabajo previo en las series documentales que se debían seleccionar.

LEETHI: ¿Cuando habla del estado de descripción de los documentos, se refiere a los metadatos descriptivos propios?

E. Cruces: No, me refiero a si existen inventarios, catálogos, es decir, sobre la necesaria existencia de la herramienta previa para conocer muy bien una serie documental, una sección, un fondo documental; y con ello la preparación de una descripción adaptada para lo que requería la informatización; de ahí parte el desdoblamiento sobre esos requisitos previos y la informatización que lleva aparejada metadatos y la estructura de la imagen. Pero había y hay que partir del inventario, del conocimiento descriptivo de los documentos. El Archivo General de Indias contaba con instrumentos de descripción elaborados en el siglo XVIII además de los que fueron realizados a lo largo del tiempo, de ellos de debió partir, para que el esfuerzo que el Proyecto requería fuera ponderado y que no partiera de un terreno totalmente desconocido.

LEETHI: En esa primera etapa, ¿qué porcentaje de documentos se digitalizaron?

E. Cruces: El archivero Pedro González García, director del Archivo durante un tiempo de desarrollo del proyecto, ha publicado datos al respecto; las cantidades fluctúan, pero se repite que se llegó a plasmar en una lista de series documentales que suponían el 12% del total de los documentos del Archivo. Por otro lado, eso no quiere decir que todo esté en imagen, lo que está es la información “informatizada” es lo que pasa hoy todavía en el Portal de Archivos Españoles (PARES), que facilita tanto la información descriptiva de los documentos como la digitalización de algunos fondos documentales históricos.

LEETHI: Luego hubo otros pasos en la ampliación de la digitalización. Supongo que con los mismos criterios de selección, aunque afrontando el problema de la calidad de la imagen, porque la calidad de la imagen de esos objetos digitales era otra en los 90 que en los 2000 o ahora en el 2025. ¿Notaron una evolución tecnológica?

E. Cruces: Lo he podido observar recientemente, como usuaria de PARES, como investigadoras e igualmente, hasta hace poco, como directora del Archivo General de Indias. El problema con las antiguas imágenes es que no tienen los parámetros técnicos, la calidad, que hoy es exigida; en muchos archivos aquellos trabajos de reproducción de documentos de épocas pasadas se han vuelto a reproducir, a digitalizar.

LEETHI: ¿Y con qué criterios se han vuelto a digitalizar?

E. Cruces: Los criterios son los mismos que se establecieron entonces: series completas para proyectos internos de cada archivo e incluso para proyectos externos, es decir, aquellos solicitados por personas o instituciones públicas o privadas. Estos criterios han de ser siempre semejantes; en primer lugar, la preservación de la documentación, especialmente de aquella que está en peor estado de conservación o se podría deteriorar en un futuro próximo; en segunda instancia, series o fondos completos para que no se ejerza un trabajo poco productivo y eficaz para la institución archivística, evitando una selección “a la carta” en su totalidad. Imaginemos unas preguntas habituales en los archivos, algo que usualmente se reclama: “¿y de mi abuelo qué hay? o ¿de mi pueblo qué se puede encontrar?; la respuesta a estas cuestiones son las mismas que para plantear un proyecto de reproducción pues todo documento forma parte de un conjunto, en concreto de una serie documental, y ello porque la Administración siempre ha trabajado con procedimientos -aunque fueran denominados de otra manera en el siglo XV y en adelante-; por lo tanto, la información sobre un ancestro o sobre una localidad, se custodiará como parte de una o varias series documentales. Otra cuestión distinta es cuando un usuario investiga o indaga un asunto y solicita unas imágenes en concreto. En todo caso, ello supone la atención a los usuarios tanto presenciales o través de otras formas de consulta. En tercer lugar, la reproducción de documentos ha de tener utilidad para quien lo solicita. Todo ello se puede abordar, a gran escala, mediante memorandos de acuerdo o convenios con otras instituciones. No hay pautas generales sobre qué documentación es la más consultada en un archivo, porque tanto la investigación científica como la necesidad de documentos por la ciudadanía fluctúa; las tendencias en investigación cambian y la historiografía también; la necesidad de documentos por la ciudadanía está sujeta, por ejemplo, a determinadas normas y períodos administrativos, como, por ejemplo, las solicitudes para adquirir la nacionalidad española de descendientes de españoles.

LEETHI: Entonces, en ningún momento utilizáis criterios temáticos, como, por ejemplo, documentación relacionada con los mapuches.

E. Cruces: En los archivos se trabaja por estructuras orgánicas que son fruto tanto de la estructura de la administración a lo largo de los siglos como de las funciones de instituciones y organismos muy diversos. Por lo tanto, en los archivos no se hacen –o no se deberían hacer- clasificaciones temáticas, excepto cuando el documento ha sido de esta manera producido. Siguiendo el ejemplo sugerido, documentos sobre los mapuches pueden existir en varios archivos –españoles y americanos- y en diversas categorías archivísticas –secciones, series- que dependen del contenido del documento, quién lo expidió o quien lo recibió. Me gusta hablar de usuarios en los archivos, pero, para este ejemplo, se ha de considerar la investigación científica, es decir, esa búsqueda de documentos para un tema concreto que corresponde al historiador o investigador que ha de aplicar el rigor de la heurística. Los archiveros no investigamos para otros, sino que tenemos que avanzar en el estudio y sistematización de los conjuntos documentales que, una vez bien descritos, facilitarán las búsquedas tanto de investigadores como de la ciudadanía. Con esas herramientas de información que se le provee al usuario éste podrá buscar donde existe documentación sobre los mapuches o sobre dónde está el capitán Henry Morgan y sus acciones violentas en las Indias Occidentales.

LEETHI: Hoy ¿cómo se procede, qué inversiones existen, qué herramientas tienen, cuál es la situación del personal? En resumen, ¿cuál es la situación actualmente?

E. Cruces: Cuando el proyecto de Informatización del Archivo General de Indias concluyó el Ministerio de Cultura asumió el progreso e implementación del mismo. Se produjo un gran cambio, primero el Archivo General de Indias y luego en diversos archivos que adaptaron su forma de funcionar. Yo comencé mi carrera profesional sabiendo que los archivos tenían que tener un taller de restauración y peleando por conseguirlo; pronto asumí –como muchos otros archiveros-, tras la experiencia del Archivo General de Indias, que un archivo debería tener un taller de imagen o taller de digitalización; por lo tanto, este objetivo fue alcanzado en muchos archivos y, por supuesto, en el de Indias. Ello significa que, en la relación de puestos de trabajo de los archivos de existir personal especializado, la responsabilidad de adquirir maquinaria técnica y lo que es más difícil aún, el mantenimiento de la misma, para lo cual no siempre el presupuesto público está preparado. Estos cambios también implican que se ha de contar con unos parámetros técnicos actualizados, lo cual no lo hace un archivo solo y que la gran inversión para todo lo relativo a la digitalización sea realizada por el Ministerio de Cultura por lo que a los Archivos Estatales Generales se refiere –aunque cada archivo cuente con presupuesto para algunas compras y para mantenimiento. Lo mismo sucede con la dotación de personal y con respecto a algo fundamental: el establecimiento y mantenimiento de criterios técnicos, la comprobación de resultados, el control de la calidad, que en el caso del Ministerio de Cultura lo hace el Servicio de Reproducción de Documentos (SRD), conocido como el SRD con una ya larga historia. Los archivos no tienen que trabajar aisladamente, no deben.

LEETHI: ¿Qué facilidades de consultas de documentos en el ámbito digital ofrecéis a los usuarios? ¿Se ofrecen consultas en modo imagen, modo texto, con qué formatos?

E. Cruces: Este asunto, el de las consultas de documentos empleando todo un producto y entorno digital se va avanzando enormemente, la referencia, nuevamente, ha de ser el Portal de Archivos Españoles, herramienta que cuenta con una modificación reciente relativa a la posibilidad de la consulta mediante reconocimiento de texto manuscrito (HTR) con indexación probabilística, si bien todavía aplicado a pocas series documentales.

LEETHI: Cuando, por ejemplo, desde el Archivo General de Indias plantean digitalizar una nueva colección ¿esto se realiza por el SRD o por vuestras propias máquinas y personal?

E. Cruces: En primer lugar, no debemos emplear el término “colección” de manera general en los archivos. En proyectos internos, propios de los archivos, cuando se decide digitalizar una determinada serie documental -con esos criterios antedichos-, lo primero es preparar, desde el punto de vista de la descripción archivística, una guía de digitalización que es el instrumento que ha de ser proporcionado a los técnicos de imagen, quienes abordan la digitalización en el propio archivo y con los criterios técnicos que el SRD en cada momento va adoptando y adaptando. Cada archivo tendrá el producto de lo digitalizado, pero la garantía de la conservación recae en el repositorio de seguridad del SRD. Se ha de tener en cuenta otra cosa importante –a los efectos de las solicitudes de consulta- que es aquella que recae en el desfase existente entre la producción del objeto digital y el control del SRD, Servicio que avala la calidad y su posterior publicación en PARES; que cada archivo procediera a esta publicación permitiría un más rápido acceso, pero tal vez derivaría en una menor uniformidad, en la pérdida de criterios comunes, en unos controles menos efectivos sobre la trazabilidad.

Asimismo, en los archivos existen proyectos externos; son aquellos demandados desde fuera de la institución, solicitados por una universidad o un grupo de investigación o una ciudad o un país, por ejemplo. Para esto hay que llegar al establecimiento de un convenio, de un acuerdo, instrumentos jurídicos que no son establecidos por la dirección de los archivos, sino que son firmados en los Servicios Centrales del Ministerio de Cultura, que analizan los contenidos jurídicos y técnicos de los mismos. Siempre he considerado que los anexos de estos acuerdos debían ser muy claros con respecto a qué conjuntos documentales estaban sujetos al objeto del convenio, qué número de documentos, y, desde luego sobre parámetros técnicos de la digitalización. La consecución de parte de los trabajos técnicos, desde luego la digitalización, suele ser adjudicada a una empresa especializada que, en todo caso, desarrolla su trabajo en los archivos implicados en estos acuerdos; empresas que acreditan su capacidad en este tipo de trabajo.

LEETHI: Queremos volver a un punto importante que mencionaste antes: la trazabilidad que está muy ligado a otros conceptos clave como la veracidad o la autenticidad de la documentación. ¿Qué se hace para preservar esa veracidad en el documento digital?

E. Cruces: Toda empresa está sujeta a un convenio como se ha dicho, y tiene que cumplir los parámetros técnicos que se les ha exigido previamente; además el control general de calidad lo va a realizar el SRD mediante entregas parciales cuando el proyecto es largo en el tiempo. En las distintas fases del proyecto, la empresa entrega parte del material digitalizado para su visto bueno y supervisión. En fin, el control -como todo lo que se tiene que hacer en la Administración Pública, es exhaustivo para garantizar calidad y un adecuado servicio público. En cuanto a la veracidad, las marcas de agua sí se utilizan como en PARES, con la cautela de que no estorbe la lectura de documentos, muchos de los cuales son de por sí de difícil lectura. También se usan marcas de agua para preservar los derechos del Ministerio de Cultura, que son de todos los españoles, es decir, de su patrimonio documental. Quien necesite hacer uso de un documento para una publicación, una exposición, una divulgación, entonces se ha de solicitar un permiso para la reproducción mediante un procedimiento existente para ello, para el pago de unas tasas y para la firma de un compromiso. Y ahí se vuelve a hacer una digitalización ex profeso. Aunque, en este mundo, ya se sabe, el incumplimiento puede surgir por mucho que la norma esté publicada en el BOE.

LEETHI: ¿Qué considera relevante para seguir con este proyecto de “informatización” o digitalización?

E. Cruces: reo que hay que fomentar el mecenazgo, de esta manera comenzó, como se ha indicado, el Proyecto de Informatización del Archivo General de Indias hace ya muchos años. Se podría poner de ejemplo, en la actualidad, el convenio suscrito entre la Dirección General de Patrimonio Cultural y Bellas Artes, del Ministerio de Cultura y la empresa Greystones, SLU para la digitalización de fondos de la Audiencia de Filipinas custodiados en el Archivo General de Indias, que permite el trabajo en con una documentación bien descrita.

En todo caso, se ha de entender que la digitalización requiere un proceso de calidad que exige tiempo. Creo que la ciudadanía debería conocer mejor estos procesos, también esa ciudadanía cualificada en la formación científica: a veces yo me he quedado muy extrañada porque muchos aún creen que la digitalización es emplear una cámara de un teléfono móvil y hacer una imagen; pero no es así. En todo caso y, de hecho, la digitalización profesional en archivos o en otras instituciones es una de las formas que abarca el potencial de acercarse más a la ciudadanía y evitar la brecha digital, también existente para la consulta en los archivos. De hecho, la digitalización en archivos es necesaria para cumplir las Leyes de Memoria y la Agenda 2030 que considera que la digitalización de los archivos es un derecho de las personas.

LEETHI: ¿Qué proyecto recuerda haberse realizado en el Archivo como novedoso?

E. Cruces: Hubo un proyecto de colaboración de edición colaborativa organizado por Archivos Estatales, denominado Editatonas en los Archivos Estatales desde el año 2024, en este caso unas actividades de edición en Wikipedia sobre mujeres investigadoras (1900-1970). Son proyectos interesantes, que, además, plantean las dudas sobre ¿qué aportan estas anotaciones colaborativas al patrimonio documental?, ¿al adecuado conocimiento de los documentos conservados en los archivos?

LEETHI: Creo que ayuda a crear una comunidad de conocimiento: puedo aportar algo sobre un documento, lo anoto y lo comparto (puede ser un comentario o una referencia bibliográfica), eso crea conocimientos ciudadanos. Sin embargo, por los procedimientos establecidos en PARES, esto es imposible porque no se permiten añadir anotaciones por razones de seguridad, incluso de veracidad. Sin embargo, podría ser interesante poder hacerlo en una especie de laboratorio de burbuja digital y es una restricción fuerte no poder aportar mi conocimiento.

E. Cruces: En parte vosotras, como docentes y como investigadoras ya habéis dado la respuesta: en cuestiones de investigación científica toda aportación, alteración, indicación, debería tener a su vez su control de veracidad, ¿pero quién hace eso? Además, en los archivos no tienen como cometido comprobar la veracidad de los hechos históricos sino el análisis del documento, de su producción, de su tradición e ingenuidad, la comprobación del hecho documentado será cuestión del científico. Respecto a la colaboración entorno a un documento o conjunto de documentos, donde cada uno aporte algo, a mí me parece positivo, pero se necesitarían procesos vinculados a esa preservación digital dentro de las instituciones públicas como son los archivos, y ahí es donde lo veo complicado.

LEETHI: Quizás podría señalarnos algo que te ha decepcionado, una esperanza que tenías.

E. Cruces: La incomprensión, todavía, existente en la sociedad española (incluyendo a los responsables políticos en materia de archivos) de lo que es un archivo y para lo que sirve. He llevado casi 43 años peleando porque los archivos sean valorados, conocidos asumidos como instituciones y organismos necesarios para la ciudadanía, que me haya jubilado no quiere decir que no vaya a seguir batallando por ello. Indudablemente, mucho se avanzó durante la Transición y años posteriores, no sólo debido a que muchos archivos salieron de los sitios oscuros —en todos los sentidos de la palabra “oscuro”, también la vinculación de los mismos con algunos asuntos relacionados con la represión—. Eso lo superamos y ahí estuvimos algunos en esos frentes que no fueron fáciles, pero yo imaginé que se avanzaría mucho más y mejor. Me admira, en este sentido, que, por ejemplo, en Francia, incluso en una pequeña localidad se pregunte por el archivo municipal y la respuesta sea afirmativa, se conoce dónde está y lo que es. Los ciudadanos tienen que conocer y saber valorar qué son los archivos y para qué sirven, en España aún se relacionan con “los papeles viejos”, mientras que los archivos son nuestras garantías de derechos.

[1] El Grupo de investigación LEETHI agradece a la Dra. Esther Cruces su entera disponibilidad para esta colaboración.

Memory and AI: A Conversation with Wulf Kansteiner by Johanna Vollmeyer

Interviewer’s note: Wulf Kansteiner (1964–2025) was a Professor at Aarhus University. This interview was conducted in June 2025, shortly before his sudden death, and is now published posthumously.[1] I was deeply saddened to learn of his passing, and I feel honored to have had the chance to conduct this interview and exchange such thought-provoking ideas with him.

Wulf Kansteiner specialized in memory studies and contemporary European history, his scholarly work focused on cultural memory, particularly how it is shaped by visual media such as television, film, and digital platforms. He was also deeply engaged with post-narrativist approaches to historical theory and has contributed extensively to research on Holocaust and genocide memory, history, and historiography.

Kansteiner pursued his academic training in history and German studies at Ruhr University Bochum and later at the University of California, Los Angeles. Over the course of his career, he held teaching and research positions at institutions including the University of Tennessee, Kent State University, Friedrich Schiller University in Jena, and Binghamton University (State University of New York), before joining Aarhus University in 2014.

He played a leading role in advancing the field of memory studies, having served as President of the Memory Studies Association (MSA). He was also a co-founder and co-editor of the journal Memory Studies (SAGE) and an active member of the international research network Mnemonics. Kansteiner led and contributed to several major research initiatives, including the Velux Foundation-funded project SoundTrak and the EU Horizon 2020 project UNREST, where he was responsible for a key work package.

In addition to his research and editorial work, Kansteiner served on multiple academic advisory boards, such as those of the Leibniz Research Consortium Value of the Past, the History of the Ruhr Foundation, and the International Network for Theory of History. He was also on the editorial boards of several academic publications and series, including Media and Cultural Memory (De Gruyter), Memory, Heritage and Public History in Central and Eastern Europe (CEUP), and the Cambridge University Press journal Memory, Mind & Media.

Key publications include the monograph In Pursuit of German Memory: History, Television, and Politics after Auschwitz (Ohio UP); the co-edited volumes Agonistic Memory and the Legacy of 20th Century Wars in Europe (Palgrave), Probing the Ethics of Holocaust Culture (Harvard UP), Den Holocaust erzählen? Historiographie zwischen wissenschaftlicher Empirie und narrativer Kreativität (Wallstein) and The Politics of Memory in Postwar Europe (Duke UP); and the articles  “Digital Doping for Historians: Can History, Memory, and Historical Theory be Rendered Artificially Intelligent?”, “History beyond Narration: The Shifting Linguistic Terrain of Timothy Snyder’s Bloodlands,” “The Holocaust in the 21st Century: Digital Anxiety, Transnational Cosmopolitanism and Never Again Genocide without Memory,” “Genealogy of a Category Mistake: A Critical Intellectual History of the Cultural Trauma Metaphor,” and “Finding Meaning in Memory: A Methodological Critique of Collective Memory Studies.” Texts are available at https://www.researchgate.net/profile/Wulf-Kansteiner-2.

Kansteiner’s latest work dealt with the relationship between Holocaust memory and postcolonial memory, the role of sound and artificial intelligence in processes of social remembrance and social forgetting, the concept of agonistic memory, the relationship between academic history and the interdisciplinary field of memory studies, and the narrative and logical structure of professional academic writing.

Interview

Johanna Vollmeyer: At the Complutense University of Madrid, we lead the research group LEETHI, within which we have been developing the project REC-LIT Cultural Recycling: Transliteratures in the Postdigital Age. The project focuses on strategies and models of literary text recycling in hypermedia environments, as well as on the potential for the reappropriation of the textual-literary at a time when users increasingly take hypermedia products as their primary cultural frame of reference.

From this starting point, a number of fundamentally ontological questions emerge—questions concerning our being-in-the-world and the ways in which postdigital media and the broader postdigital condition shape this mode of existence. As is well established, identity and memory are deeply intertwined with our being-in-the-world. Today, I would like to reflect with you on how this condition is undergoing significant transformations in response to contemporary digital developments.

So let me begin by expressing my sincere thanks for your time and attention.

My first question concerns younger generations, as they are the ones who primarily receive information through digital media. I believe this shapes their consciousness of the world and, more specifically, their historical consciousness. I would like to know your opinion on how the consciousness of young people—who seldom consult sources beyond social media, if at all—is changing. How is their perception of history being shaped by this media use? And what impact do more recent AI-based sources have on this development?

Wulf Kansteiner: It is true that social media have a major impact and are certainly shaping entire generations in ways that we are now considering across different countries. There seems to be an emerging understanding that the kind of access to social media we have allowed young people may be problematic. I share this concern to some extent, although I would immediately qualify it: I don’t think that this is a problem of the digital in and of itself.

Rather, I think we do not know enough about the digital—specifically, how we have structured our transition from an analogue electronic to a digital media ecology. This transition has been framed in terms of power—organized within a neoliberal, highly capitalist framework. And only now, somewhat belatedly, are we recognizing how deeply problematic that framework is.

This has profound implications for our memory culture—with our post–Cold War memory culture, which, in my view, has naturalized the neoliberal-capitalist framing of our being-in-the-world. That naturalization, to use an ironic term, has proven to be very expensive for us as human beings.

One must immediately add that all media ecologies come with strengths and weaknesses. Social media platforms are not neutral containers of content. They can be fantastic in some respects and deeply flawed in others. But the core issue right now may be the way we have organized digital mediation: in very specific and problematic terms. We know very little about how to organize a digital culture in terms of public access and public mediation—such as we had during the electronic age with public television and radio. Those older forms of mediation were very powerful. Now, we are lacking these and rely on platforms that are highly profit-driven, centralized in private corporations, and largely unregulated. We are only just beginning to assert control over them.

That is our specific challenge at the moment.

So we should be cautious about making definitive statements about digital culture. Nevertheless, I believe we can speak to some of the concrete dangers concerning memory, education, and historical consciousness—especially among young people using specific platforms. These include a lack of democratic access and control, and a lack of transparency. Media literacy is crucial—but it is very difficult to teach without these fundamental structures in place.

So there are some clear problems, although they are not necessarily the ones that are often raised, addressed, or reflected. For instance, the question of facticity — I am thinking of deepfakes— does pose problems, I agree. But not in the way we generally assume. I would phrase these risks and dangers differently than some other theoreticians do, contextualizing and conceptualizing them differently.

JV: Am I right in hearing a critique here that many researchers are not addressing the fundamental problems, but instead focus on issues like deepfakes, as if these were the core challenges of digital media and the digital media ecology—while neglecting the actual underlying problems?

WK: I think it’s a common tendency to essentialize new phenomena—trying to fix their risks and benefits too quickly. Interestingly what’s often overlooked in this process is our personal relationship to media. But what we really need is to take a historical perspective. We need to compare transitional periods. We’re clearly in such a transitional period now—a radical shift. You can observe it even in the last six months with the breathtaking development of AI.

Of course, it is a problem that these platforms are “great at lying” and have a problematic relationship to historical truth. But what also emerges—what always emerges during a shift in media ecology—is a new understanding of previous ecologies. We suddenly realize we didn’t understand or underestimated their limitations. Now, we can appreciate those earlier parameters more clearly.

One insight I’ve gained is that factuality is not, in and of itself, a sufficient value for memory cultures. That’s a painful realization for historians. Philosophers and theorists have said this for decades, but it hasn’t changed historical practice—or the ways memory cultures are produced, especially in visual media. We assumed that honoring facts would lead to a decent memory culture. We’re learning now that this isn’t true. A memory culture can be factually accurate and still disastrous—or it can lack factual integrity and still be ethically responsible. This is also thinkable.

This teaches us a difficult but important lesson: there is a difference between facts and interpretations. They are interconnected but fundamentally distinct. Good facts do not necessarily produce good interpretations, and vice versa. I call this the factual vacuity of interpretation and the interpretive vacuity of facts. Facts themselves don’t tell us how to interpret them, and interpretation based on lies can still have ethical integrity. That’s a very provocative idea, but I think it’s one we need to understand. This applies to how we negotiate and engage in learning processes. It is a conversation we should have with younger generations, focusing on their concrete use of digital media and on where boundaries might need to be drawn. Because we need to establish limits—especially with regard to digital lying since the scale and speed at which lies spread is deeply concerning.

At the end of the day, I’m more frightened by harmful interpretations than by a lack of factual integrity. Take the example of Donald Trump in the U.S.: what makes him so dangerous is not merely his lies, but his complete lack of ethical integrity. His values are terrible. Yes, he lies constantly, but the real issue is his disregard for democracy and basic responsibility. As a side note, he is also consistently lying. In this case, these elements are combined, but they do not necessarily have to be.

JV: Would you say that digital or postdigital media favor people who lack ethics? There have always been unethical people, but perhaps the dynamics are now different. Where do digital media come into play?

WK: I’m very cautious about making essentialist claims that digital media inherently promote unethical behavior. It’s not the media themselves, but how we’ve framed, structured, and powered them. Let’s take an example: in analogue electronic media, we had gatekeepers, for better or for worse. Many people lacked direct access to television—then the dominant medium—and access was regulated. Some structures were unfair, others necessary. But they were always about power.

Now, we have a strange historical combination: on the one hand, decentralization, which can be democratizing—people can participate without needing a TV channel. But on the other hand, we have an extraordinarily centralized structure of power in the hands of private actors with dubious motives—mostly commercial. That combination is a recipe for disaster.

This is why I now advocate for media regulation. You could call it censorship if you like—but I would argue that we need democratically legitimized institutions with the power to enforce ethical standards on platforms. These decisions—about what content to remove, what lies to eliminate—are incredibly powerful and must be taken by legitimate public bodies.

At present, the entities setting the boundaries of digital discourse have no democratic legitimacy. The only major player with some legitimacy is the European Union, and even that is limited. We need public boards, elected institutions, and open debate. Young people should be part of this. They should vote on who serves on these regulatory boards—even at ages 14 or 15—because they experience digital media in ways older generations do not. But we are far from that reality. At the moment, our most powerful moderators are Silicon Valley companies and the Chinese government. That is unacceptable.

If we leave decisions about collective memory and forgetting to the likes of Elon Musk, we are heading for disaster—not necessarily because he is a bad person, but because it is simply a bad idea to give that much power to one individual or one group.

JV: You’ve raised several key points here. You mentioned gatekeepers like traditional TV, where everyone watched the evening news and had access to the same information. That shaped a shared information ecology. Now, with personalized platforms and algorithms, information is individualized. As McLuhan said, “the medium is the message.” Today, we have decentralization of content alongside centralization of power in private hands, which has a massive impact on checks and balances. You spoke of the need for limits—and I agree: only within limits can freedom exist. Without limits, there’s no protection for minority groups.

WK: Absolutely. Minority representation remains a challenge in digital media ecologies. That’s where we need to look closely—especially with AI. Even in the past, our gatekeeping systems were flawed. People may have consumed similar products, but their memory cultures differed. Beneath the surface, many alternative or even ugly memories were active. Public media were never perfect.

So we must invent ways of transforming mediation and limit-setting into an ongoing process of self-reflection. It will never be finished or perfect. But it is necessary. Each year we should ask: what injustices have occurred through censorship? But also how much injustice has been done by failing to capture, safeguard, and protect certain segments of the population—particularly minorities? This will never go away—and perhaps never did.

JV: I think Germany is a clear example for these “ugly memories” that you have mentioned. Despite a seemingly successful memory discourse, we now face the rise of the far-right party AfD (Alternative für Deutschland). This cannot be attributed solely to digital media. As you said, these currents were always there, just beneath the surface.

WK: Absolutely. Our research shows that beneath the apparent consensus of cosmopolitan memory, there were pockets of Nazi nostalgia and antisemitism. These are now visible on social platforms. And perhaps we should welcome their visibility—it gives us a chance to address them.

JV: So where is memory headed? These layers are now visible, and that can be an opportunity. What threats and opportunities do you see—especially with AI? And how should Memory Studies critically respond?

WK: In our current context, artificial intelligence is being used in highly problematic ways, essentially functioning as a form of digital communication “on steroids.” The speed and reach of communication—and the reproduction of memory structures—have increased dramatically, but these processes are often deeply troubling. For instance, certain types of interpretations, such as right-wing narratives, can be seductive, politically charged, and yield consequences that, at least from my perspective, are undesirable. Thus, the issue of framing is once again central to the problem.

There are also challenges that may be inherent to the technology itself, and I believe it is crucial to recognize that we are still at the very beginning of this development. It is a revolution already underway, but nevertheless still in its early stages. I anticipate that certain aspects will continue to evolve. Data centers for AI are massive and energy-intensive, built by just three major players. The goal is to create AI that mimics human reflection. The current design of artificial intelligence involves a peculiar combination: it fundamentally operates on probabilistic calculations, followed by rather crude filtering processes. This approach represents only an initial step. At present, the machine’s reliance on probability, combined with subsequent filtering, tends to produce homogenous and often problematic outcomes. However, it remains to be seen what forms of reflective capacity might emerge with the development of new machines, particularly as quantum computing technology advances. It is conceivable that future AI systems could be embedded within programs capable of relatively sophisticated ethical self-reflection and self-criticism.

It’s too early to judge whether this will be ethically disastrous or beneficial. Humans are pragmatists and often fail to follow their own ethics—we need institutions to help us stay accountable. Maybe machines, if designed with reflective ethics, can do better. It could very well be that artificial intelligence is much better in, for example, governing scarce resources and providing people with access to resources in a way that is much fairer.

At present, we are confronted with significant challenges due to the rapid proliferation of highly problematic content. We also face a complex situation—one I am not yet certain should be regarded as entirely disadvantageous. We have already entered a state in which memory cultures are no longer exclusively human; a substantial portion of the texts that the average individual in digitized societies interacts with and consumes daily is AI-generated. Thus, memory culture has become partially nonhuman, representing a form of human–nonhuman collaboration. Whether this hybrid condition constitutes a problem ultimately depends on its impact—for example, on the survival of the planet and perhaps also of the species, depending on one’s anthropocentric perspective. The verdict on whether this is ultimately problematic remains open.

What we can assert with confidence is that the current manner in which AI is being used poses problems. Presently, forces opposing environmental protection and an ethics of care are more strongly entrenched within AI systems than their opposites. This imbalance largely stems from the fact that these systems are built around short-term profit rationales.

JV: Human beings tend to think hermeneutically, whereas machines—leaving aside quantum computers—must sequentialize and essentialize the world to make it computable. This is fundamentally different from how we act. It’s as if machines must “freeze” an image of a person or event in order to process it, whereas humans operate within indeterminacy. This indeterminacy fosters development, because it allows for open possibilities. That’s a big contrast with what AI does. So do you really think that AI can provide us with so many opportunities and foster a positive development?

WK: I’m not convinced that the human track record gives us much to celebrate. Just look at the centralization of power, industrialization, and the ecological damage we’ve done. Our species has often made poor collective decisions.

Indeed, there seems to be different between quality knowledge and quantifiable knowledge and that’s what your dichotomy is kind of based on. But I’m not sure it will hold in the future.

More powerful computing might one day approximate forms of ethical reasoning or creativity that we’ve traditionally considered uniquely human. We’re just at the beginning. Judging AI now is like evaluating the car industry based on prototypes from the 1890s. I’m sceptical of the claim that powerful machines can never match human-level qualitative understanding. We’re already seeing that AI can anticipate and replicate many forms of human behavior—at least collectively.

And here’s the question: what are we missing in this process? Memory scholars often assume that good memory fosters good societies—democratic, sustainable, ethical ones. But what counts as a “good” memory is under question. Take Holocaust memory: we believed it would promote ethics and care, yet these memory cultures are sometimes co-opted in ways that reinforce racism—conscious or unconsciously.

Still, one thing we do know—at least about humans—is that identity is built through narration. Narratives follow patterns, and AI is extremely good at recognizing and generating patterns. If ethical or “good” memory is based on strong narrative patterns, then AI could be a powerful tool. Today’s language models can already reproduce genres and narrative structures with impressive fluency. So if patterns is at the heart of our good interpretations then this is a potent tool.

JV: That raises a crucial point: semantics. In terms of semantics, computers still have a long way to go—even though they’re improving rapidly. However, semantics is a vast field of research, and machine capabilities remain quite limited compared to human understanding. This is why I remain cautious. I agree, patterns matter, and AI is becoming more grounded, but their grasp of semantics is still shallow. That’s why we sometimes end up with discourses that feel overly simplistic.

WK: But who decided that simplicity is bad? You’re right to highlight semantics. The question is whether computers are inherently limited in semantic depth due to their architecture. Many would say yes, since quantification is their foundation. That is the computer’s DNA.

But consider how societies function: powerful interpretations of the past are rarely semantically rich. Identities—even those key to democratic societies—are not highly complex in practical terms. Complex ideas must be translated into simpler narratives for democratic engagement. If they remain too intricate, they lack political traction. That’s a human limitation. So, I don’t think semantic simplicity necessarily works against machines.

In fact, digital culture and AI might help us include more people in decision-making processes by making core values and stories more accessible. Complexity isn’t inherently virtuous—sometimes it paralyzes action. And in our current crises, we can’t afford inaction.

Take Anthropocenic memory as a test case. It doesn’t take a scientist to understand we’re using resources unsustainably. That’s a simple truth. Yet we’ve failed to turn that truth into policy or lifestyle changes—even in societies that claim to have a well-developed ecological conscience, like the Scandinavian countries. There’s a disconnect. And the problem isn’t a lack of understanding or complexity. But we need to change.

JV: That makes me think: perhaps we’re focusing too much on what machines are or can do—and not enough on the narratives we construct about them. We tend to anthropomorphize them instead of seeing their unique capabilities and limits. Maybe we need new narratives that don’t just mirror us but clarify where machines excel and where we do.

WK: Exactly. That’s what I’ve been trying to emphasize. One advantage machines might have is consistency. Compared to human culture, machines could follow values and goals more coherently. Humans often build beautiful memory cultures—like ethical commemorations—then act in ways that contradict them. We admire the memory but ignore the lessons. Machines might avoid that inconsistency.

Ironically though, as machines become more “human-like,” they might also become less consistent. That’s possible. But I don’t feel equipped to make that judgment yet. So I choose to remain hopeful.

JV: You mentioned narrative’s importance to memory. With the rise of strongly text-centered, generative AI – think of Large Language Models – , would you say we’re experiencing a new linguistic turn? We’ve had the visual turn before. And AI is also becoming better and better in producing images. Since you are also an expert in visual media I would like to know from your side if you would agree with this statement that we living now a new linguistic turn.

WK: I think this is just a temporary phase. It has to do with technological development. There’s a kind of window, and we don’t know how long it will last—but my guess is, not very long. Especially in the academic world, there is a return to the text. Many academics never really transitioned into visual culture. Think of historians: they never made the shift. We’ve never reached a point where the next generation of historical researchers delivers their PhD thesis in the form of a documentary film. We are still writing texts.

So, many academics, including historians, are quite happy right now, because suddenly text and textual qualities have regained value. Artificial intelligence is really good with texts—but that’s just a phase. That’s because texts, compared to other types of cultural mediation, are simple. They can be counted, measured, calculated. That’s why text is beautiful—and indeed, we’re seeing a wave of research institutions returning to text analysis through digital means. That’s perfectly fine.

But when it comes to collective memory and popular culture, we will never return to text alone. It’s not going to happen. Social media platforms—the powerful ones—already operate on different layers of communication. Take TikTok or Telegram: they are fabulously multilayered, and also, very ironic. That’s important. People are using these platforms to subvert the old, unironic gatekeeper culture. This new culture is highly visual and highly ironic.

There’s a constant tension between different media layers—between text and image—and this tension is exactly what people are working with today. I don’t think you can build a popular platform for the crafting of collective memory that works only textually. If you want to reach young people on these platforms, visual elements are essential.

Very soon we’ll be able to produce film with artificial intelligence at the level we currently produce text. Right now, we’re limited by computing power. How long that limitation lasts—I don’t know. But the machines being built are specifically meant to break that barrier. The goal is to generate visual culture with AI that is as compelling as what we already consume. In some media contexts—like video games—it’s already happening.

And that’s the metric: it’s always about whether people feel the image is “authentic” or “believable.” There are fantastic opportunities here. Imagine developing a visually and ethically compelling piece on the Holocaust. That still hasn’t happened because we haven’t made the transition yet.

JV: I thought of that when I saw the Sophie Scholl Instagram account. To me it seemed like a missed opportunity. From a media perspective, it was technically well done— with these videos where Sophie is filming herself, which of course was impossible in the 1940s and, however, there was no friction or incoherence in this media use. But the message conveyed was ethically questionable.

WK: I absolutely agree. That example really highlights the tensions between two media ecologies. In the old analog or early electronic gatekeeper culture, irony and sarcasm were excluded. In the new media ecology, irony and sarcasm are the focal points. To work today, Holocaust memory culture would have to include irony—and that was, of course, completely taboo for the creators of that account. They simply took an analog narrative and imported it into a digital environment. Maybe it works for us “older” people—we recognize it as a kind of television miniseries. But it doesn’t resonate with the younger generation crafting and sharing images. They’re working with irony, ambiguity, and undecidability.

It has long been assumed that irony is incompatible with serious topics such as Holocaust memory—yet perhaps this assumption merits reconsideration. The central question concerns how to navigate this transition responsibly. I respect the decision of major video game companies to refrain from creating Holocaust-themed games, as no one has yet devised an ethically sound approach to such representations. It may be that digital cultures are ill-equipped to address questions of cosmopolitan narration or the binaries of victim and perpetrator.

However, digital culture might be particularly suited to engaging with what Michael Rothberg terms implicated subjectivity. Digital platforms may be capable of negotiating irony and undecidability, especially within the ethical gray zones where roles and responsibilities resist clear definition. It is conceivable that digital media’s strength lies in its capacity to explore this implicatedness.

Consequently, there is a pressing need to establish explicit ethical boundaries within digital culture. For instance, is it ethically permissible to assume the role of a mass murderer in a digital game? Should such portrayals be prohibited? Alternatively, might it be acceptable to simulate the biography and process of radicalization of a perpetrator, but only up to the point before any atrocities are committed? This demarcation—the simulation of all actions except the moment of violence—could constitute an ethical boundary. These questions are crucial for determining the limits that digital media must observe.

JV: In the specific case of Holocaust memory, there’s another issue: we know how it ends. There’s no good ending, no escape. That makes it extremely difficult to create a game around it.

WK: A compelling game might move players from the collaboration end of the spectrum to the resistance end. There are independent games that explore this gray zone. This War of Mine is one of them.

JV: I would like to turn to the question of artificial intelligence in research. You have noted the importance of simple patterns and narratives in memory culture—an observation with which I concur. However, it is equally imperative that we critically reflect on our own practices as researchers. The increasing integration of digital tools and AI across disciplines—including history and memory studies—has brought a pronounced emphasis on quantitative analysis. For instance, within literary studies, numerous colleagues prioritize digital text analysis to the extent that qualitative interpretation is often marginalized. But the outcomes of their analysis and interpretations of, let’s say the Gimm’s fary tales are quiet poor.  While I do not oppose the use of such tools, I maintain that rigorous qualitative interpretation remains indispensable.

WK: There are two critical points to consider here.

First, we are currently gaining new insights into our own research practices across diverse media ecologies. The ability to analyze texts such as the Grimm’s Fairy Tales quantitatively and in great detail does not, in itself, guarantee that the results are meaningful. While such analyses yield robust data—such as the frequency of specific words or their evolution over time—these results invariably require interpretation. Importantly, interpretation is always situated within particular perspectives, which are underpinned by ethical and political frameworks that cannot be derived from the texts themselves.

This dynamic is also evident in digital history. As new subfields emerge, there is often an assumption that factual data alone suffice. Although it is possible to generate extensive factual information, facts in isolation possess limited interpretive and ethical significance. Therefore, the crucial question becomes: from which perspective, and with which underlying value system, do we interpret these findings?

Historically, researchers have often been reluctant to make their values explicit, perceiving such disclosures as unscientific. Yet this reticence is not unique to the humanities; even the natural sciences have witnessed the production of excellent research that has served terrible masters. Within digital humanities, a comparable misconception persists: a naïve belief that the mere generation of facts guarantees sound research. This was a mistake made in previous media ecologies, and it is being repeated. However, research and memory are fundamentally about values.

Second, digital media—and particularly artificial intelligence—offer new possibilities, including within hermeneutic practices. AI enables us to construct ethically sensitive counterfactual scenarios previously beyond reach. For example, in examining moments of extreme violence, we have traditionally relied on survivor testimony, which is invaluable but constrained by ethical considerations that prevent certain lines of inquiry. AI, by contrast, can simulate such moments based on extensive source data, providing novel perspectives.

These inquiries are fraught with ethical risk: for instance, exploring the mindset of individuals on the verge of committing mass atrocities. It would be unethical to question survivors in this regard due to the risk of retraumatization, yet AI might allow us to probe this space. Similarly, AI can be tasked with generating disturbing right-wing historical interpretations—not to endorse them, but to understand their appeal and structure. In some cases, AI-generated extremist narratives may prove more persuasive than those offered by human interviewees, yielding valuable insights.

Thus, while these tools entail significant risks, they also permit textual—and soon visual—experiments that would have been ethically untenable previously. This capability is especially pertinent to the memory of the Anthropocene, where counterfactual thinking—imagining alternative futures or preventable outcomes—is central.

If AI enables the construction of counterfactual narratives with ethical sophistication, it holds considerable promise. We have yet to determine how to employ these technologies responsibly, but this challenge lies at the heart of scholarly inquiry. It also underscores the necessity of maintaining research environments that afford intellectual freedom—including the freedom to fail. Unlike popular memory culture, where public failures are intolerable, research demands the capacity to experiment, evaluate results, and, if necessary, conclude that certain findings should not be disseminated. This is the essence of rigorous scholarship.

Memory culture at large may not tolerate widespread errors; here, a potential disconnect emerges. While this may sound elitist, it is less about elitism and more about scale: errors must be confined to the relatively small scale of research rather than proliferating broadly within public discourse.

JV: That connects to your earlier point about memory not being fact-based. I’m a literary study scholar and literary products are appreciated as conveying a kind of truth, despite being fictional text. They might convey more “truth” than a fact-based historical text.

WK: Yes, but this concerns a different mode of truth—an interpretive, narrative truth. In fact, I would argue that the term “truth” itself may be somewhat misleading in this context. We are not primarily addressing empirical facts; rather, we are engaging with ethical truths—values to which we consciously or unconsciously adhere. Accurate factual information does not inherently produce sound or meaningful interpretations. As you rightly noted, storytelling conducted with integrity is far more likely to cultivate a meaningful culture of memory. The factual basis of a narrative may be secondary—whether it is fictional, counterfactual, or even predicated on errors. What ultimately matters is the integrity and ethical coherence of the narrative itself.

JV: What about the limitations of AI, particularly regarding interpretation? For instance, in the case of the Grimm tales, AI can perform quantitative analyses such as word counts and pattern recognition, yet it remains incapable of interpreting words with the nuanced understanding that a human can provide. This is especially true in poetry and fiction, where words carry multiple layers of meaning and connotation. Currently, AI excels in syntactic processing but remains limited in semantic comprehension. While this may evolve over time, it is essential to remain attentive to the current capabilities of these tools and to continuously reassess their potential as they develop.

WK: You raise a compelling technical issue, and although I do not have a definitive answer, I can outline the problem. Currently, machines lack what might be called vertical memory: they calculate probabilities but cannot specify the exact data underpinning those calculations. Achieving this level of transparency would require computational resources far beyond what is presently available. In the future, however, machines may be capable of greater transparency—disclosing the specific texts they were trained on, their age, and their provenance.

Such transparency would represent a significant shift. It would allow us to compare AI systems and conduct ethical evaluations, enabling judgments such as whether one system produces more ethically sound outcomes than another. At present, these models function as black boxes—not only to the general public but often even to experts in the field.

This situation may evolve, positioning us better to evaluate, curate, and shape AI tools responsibly. It might even become feasible to train large language models exclusively on texts demonstrating high interpretive integrity. Although no one has attempted this yet, and it remains uncertain whether it would succeed, the possibility warrants exploration.

JV: Thank you very much, Wulf, for taking the time to answer these questions. You’ve shared so many valuable insights—we truly appreciate it.

[1] My warmest thanks to Wulf Kansteiner’s wife, Sonja Wolf, who kindly granted permission for us to publish the interview.

C2DH: Critical and Creative Digital Humanities Against Technological Solutionism by Bruno Ministro

C2DH: Critical and Creative Digital Humanities Against Technological Solutionism

The first part of the title of my blog post plays with the familiar acronyms of European research frameworks and funding schemes—especially Portugal’s newly announced AI2 agency, which will soon replace the Foundation for Science and Technology. This new agency promises to prioritize innovation, product development, and knowledge transfer over fundamental research. The second part of my title, “technological solutionism,” refers to a term popularized by Evgeny Morozov, which describes the belief that technology can fix all of society’s problems.

In combining these two initial provocations, I argue that critical and creative approaches in the digital humanities can serve as a counterpoint to both the instrumental reshaping of research agendas and the seductive promise of technocratic fixes.

The digital humanities are sometimes seen—by both practitioners and detractors—as a kind of “reengineered” humanities. For many scholars, digital humanities offer a way to bridge the humanities and the digital landscape. Some find that the discipline has opened up new methods and/or new objects of study, while others see it as a matter of branding and self-interest, aligning the “digital” in “digital humanities” with funding priorities. In this view, it becomes a convenient strategy for securing grants, advancing careers, and shaping new institutional agendas.

Conversely—but not entirely differently—for many scholars viewing the digital humanities from the outside, and who still treat it as a novelty even after decades of development, the digital humanities often appear as a form of applied research that turns humanities inquiries into tangible scientific products. Yet, at the end of the day, the now-famous syntagm still places “humanities” at its center. Put another way: digital humanities are not the humanities done by computing engineers. So, if we return to funding agencies, “No soup for you!” for those who remember the 1995 Seinfeld episode “The Soup Nazi.”

Tree and Forest

In 2022, I was fortunate to have my research project funded by the Portuguese Foundation for Science and Technology. Running from March 2023 to February 2025, To See the Tree and the Forest. Reading the Poetry of António Ramos Rosa from a Distance proposed a speculative framework that brought together critical and creative approaches within the digital humanities.

In this blog post, I’d like to briefly revisit one of the initiatives developed by my research team in collaboration with guest artists: the exhibition Matéria Viva [Living Matter], held at Instituto Pernambuco in Porto from October 17 to November 15, 2024. While outlining the exhibition’s general contours and the curatorial practice that shaped it, I will also reflect on what it means to bring critical and creative perspectives together in the digital humanities, both in this section and in the following one.

Broadly speaking, the idea that creative gestures can serve as critical acts was the guiding principle that led us to invite six intermedia and digital artists to develop new works that appropriate and expand the poetry of António Ramos Rosa. The resulting pieces—created by Catarina Braga, D1G1T0 indivíduo_colectivo, Isabel Carvalho, João Castro Pinto, Rui Torres, and Terhi Marttila—span a range of genres and technologies, including interactive design, combinatorial algorithms, artificial intelligence, video games, visual art, and soundscape composition. The Matéria Viva exhibition is thoroughly documented on the project’s website.

In developing this crucial component of the Tree and Forest project—whose work packages were largely devoted to computational text analysis and data visualization—our research team drew direct inspiration from the long tradition of using computational media to process language and generate new texts. This includes works of combinatorial and permutative poetry that predate today’s generative artificial intelligence by decades. Like many scholars and artists, we look to electronic literature as a creative model for exploring critical pathways in poetic practice—particularly when these works invoke, play with, and repurpose preexisting texts, recycling, remixing, and redistributing them into new literary forms.

Critical and Creative

Critical thought naturally emerges whenever creative work comes into being—literary and artistic practices have long offered alternative epistemologies for seeing and making sense of the world. None of this is new. But what happens when creative work is produced expressly within the context of a research project, drawing from and contributing to its inquiries and experiments?

In seeking a tentative answer to this question, I’d like to broaden the frame beyond the Tree and Forest project and the Matéria Viva exhibition. What follows is a discussion of three examples where critical-creative models have been applied within the context of different research projects.

First, I’ll comment on Machines of Disquiet, created by artist and programmer Luís Lucas Pereira in collaboration with the LdoD Archive project, which focuses on representing Fernando Pessoa’s Book of Disquiet. Second, I’ll turn to La Boîte à poésie, developed by Atelier Raffard-Roussel in the context of the Oupoco research project—an initiative closely inspired by, and connected to, the early experiments of the Ouvroir de Littérature Potentielle. Finally, I’ll examine a set of digital recreations of experimental poems from the 1960s, created by Rui Torres and others in the context of Po-ex.net, a digital archive dedicated to Portuguese experimental poetry.

These three projects engage in literary experimentation using source texts from modern and contemporary French and Portuguese literature. By presenting and commenting on them, I aim to contrast creative and critical approaches with the increasingly dominant instrumental tendencies in the digital humanities—tendencies that often adopt harshly utilitarian, deterministic, and monolithic perspectives on humanities objects and methods.

What’s at stake here is not the opposition between quantitative and qualitative methods, nor a naïve rejection of computational tools. Rather, it is about how we imagine methodologies that are hybrid not only in form but in spirit. A critical-creative digital humanities does not dissolve interpretive traditions—it expands them.

In this mode, creative and critical digital humanities become generative, disruptive, and vital. These are the practices and postures that keep the field open—not just to new objects or methods, but to new ways of thinking with and through them.

Book of Disquiet and Machines of Disquiet

Máquinas do Desassossego (2017), or Machines of Disquiet (also available in English), by Luís Lucas Pereira, builds on Fernando Pessoa’s Livro do Desassossego [Book of Disquiet], a highly fragmented and truly unclassifiable prose work. More specifically, these creative “machines” rely on the version of the Book developed by and represented in the digital platform LdoD Archive, a result of the research project suggestively titled No Problem Has a Solution: A Digital Archive of the Book of Disquiet coordinated by Manuel Portela (editor) and António Rito Silva (software architecture) at the University of Coimbra since 2010.

As proposed by Portela in Literary Simulation and the Digital Humanities (2022), the LdoD Archive is more than a digital scholar edition or archive; it is an evolving engine for the experimental and performative simulation of literary processes. This is one of the primary reasons why its role-playing principle supports the emergence of new critical and creative activities from within.

Through the LdoD Archive and its instantiation of the Book of Disquiet, Pereira’s Machines of Disquiet uses Pessoa’s book “as a modular textual database for a series of applications that engage digital modalities (text, image, sound, animation) and interactions through programmed permutations at different scales (from letter to word to sentence)” (Pereira, 2017: n.p.).

In this context, these machines invite us to reread and reexamine the Book of Disquiet in creative and playful ways. Will this rereading differ from reading the book in traditional ways? Of course. Will something new emerge from this different form of engagement? Absolutely. Is this a better way or a necessity? That’s beside the point. Machines of Disquiet are anti-utilitarian by design: they are made for fun, reflection, and experience—and they stand as aesthetic objects in their own right.

Ouvroir de Littérature Potentielle and l’Ouvroir de Poésie Combinatoire

Launched in 2018, Oupoco (l’Ouvroir de Poésie Combinatoire) is directed by Thierry Poibeau and developed within Laboratoire LATTICE at École Normale Supérieure—Sorbonne Nouvelle. As the name suggests, the project is deeply influenced by the Oulipo (Ouvroir de Littérature Potentielle) movement and, in particular, draws direct inspiration from Raymond Queneau’s Cent mille milliards de poèmes—a book that materially enables the combination and recombination of its verses to generate countless variations.

Following an initial automated analysis of rhyme and other phonetic features in 19th- and early 20th-century French poetry, the Oupoco team developed an application that generates new poems from a corpus that includes sonnets by Charles Baudelaire, Amélie Gex, Théophile Gautier, Arthur Rimbaud, Renée Vivien, and many others (see Mélanie-Becquet et al., 2022; 2024).

In addition to the online application, another artifact created within the scope of the project is La Boîte à poésie [The Poetry Box]. Developed in collaboration with Atelier Raffard-Roussel, this object takes the form of a physical box with a hand-crank mechanism, allowing users to generate new sonnets by turning a handle, a fascinating blend of mechanical interactivity and algorithmic creativity.

Oupoco embodies a strong connection between the datasets prepared by the research team and the creative potential to reread and recompose these textual resources. La Boîte à poésie extends this method into a tangible, performative space.

The analyses, datasets, and algorithms developed for Oupoco are not designed to mimic or replace the sonnets and poets they draw from, nor to impersonate them—at least not in the way many AI projects today aim to do. In that sense, the project remains profoundly anti-utilitarian. It is less concerned with extractive or imitative logics and more invested in fostering creative thought and reflection.

PO.EX and PO-EX.net Recreations

Like other neo-avant-gardes emerging in the 1950s and 1960s, Portuguese experimental poetry (a.k.a. PO.EX) was deeply entangled with technology. These poets worked across a range of media, from print to audio and video, and were equally engaged with the leading theoretical developments of their time, particularly in information theory and semiotics.

The initial nucleus of this movement was the magazine Poesia Experimental [Experimental Poetry], published in two issues in 1964 and 1966. Nearly forty years later, Rui Torres revitalized these poetic legacies through two projects at the University Fernando Pessoa. The first involved analyzing magazines and catalogs from the 1960s, culminating in a CD-ROM with digital versions of these materials. The second extended the collection into the 1970s and 1980s, paving the way for the creation of the PO.EX Digital Archive.

In addition to digital facsimiles of literary magazines and exhibition catalogs, the 2008 CD-ROM included digital adaptations of selected experimental poems—translating them into new kinetic and interactive forms. Originally developed in Flash, later discontinued by Adobe in 2020, these recreations were recently restored and re-released using Ruffle, an open-source Flash emulator.

The eight digital recreations expose the processual and semiotic dimensions already embedded in the original poems. For example, in “Poemas encontrados” [Found poems], António Aragão used a technique of informational collage composed solely of newspaper headlines; in its digital version, Rui Torres, Nuno F. Ferreira, and Jared Tarbel reimagined this method using an RSS feed that updates the poem’s interface in real time.

The PO-EX.net recreations remind us that nothing is lost when we treat print and digital media as complementary—and that much is gained when we refuse to subject unruly materials to static documentation. Let the media perform: their gestures tell us what the archive alone cannot. Inspiration and rereading previous texts open the way to new inventions, new inspirations, and new potential rereadings.

Why does this matter? And why should humanities scholars care about it anyway?

We are currently witnessing what could be described as a second wave of reengineering within the digital humanities. By “reengineering,” in practical terms, I mean those recent shifts that reshape what digital humanities once stood for. More literally, I use “reengineering” to name the growing influence of engineering paradigms—both in discourse and practice—on the conceptual and methodological terrain of the digital humanities.

We know that the digital humanities have always been interdisciplinary, with computing science playing a vital role in many projects. Yet twenty, ten, or even five years ago, it was far less common to hear researchers claim a strictly objective perspective on humanities objects—when what is often really meant is a quantitative approach that conveniently sidelines the long-standing hermeneutic and interpretive traditions that brought us here. The issue is not the use of quantitative methods per se; rather, it is the accompanying posture of superiority that casts those who don’t use such methods as indulging in subjective, flawed, or deficient scholarship.

The rise of this technicist ethos in digital humanities is not accidental—it is a direct consequence of broader shifts in academic economies and cultural narratives. The dominance of AI discourse, the proliferation of “big data” rhetoric, and the systemic prioritization of quantifiable outputs have created a climate in which interpretive labor is undervalued, often dismissed as merely subjective or non-rigorous.

Ultimately, such propositions and judgments promote a strictly utilitarian view of humanities research—one that holds critical thinking hostage to what can be extracted, classified, operationalized, and replicated. This trend has been noted and critiqued by several scholars across different contexts, including in multiple posts by Amelia Sanz Cabrerizo on the RecLit blog. (See, for example, her recent reflection on orthodoxy in the digital humanities after attending two of the field’s major conferences.)

When digital humanities first emerged and consolidated decades ago, most projects centered on building archives and databases. The keyword was accessibility. Scholars worked to make knowledge widely available, digitizing collections of various scales, curating data and metadata, and making digital surrogates of texts, images, and objects accessible for new research.

Today, with the rise of machine learning, generative artificial intelligence, and other emerging technologies, digital humanities projects look quite different. So far, so good. But building upon the collections previously digitized, some scholars now seem to fetishize having machines read those sources for them—all that’s needed is the right method. The new keyword is extraction. Knowledge is expected to result from a process that devours earlier materials and forms of inquiry: massive amounts of data as input, complex or semi–black-box procedures in the middle, and neatly packaged, simplified outputs at the end. Caught in this loop, digital humanities risk leaving no space for creative or critical approaches. Or do they?

If today’s digital humanities are caught between fetishizing methods and fetishizing solutions and potential impacts, the projects I’ve highlighted reveal a different path—one where reading becomes play, where archives become engines of reinvention, and where literary works live again in unexpected environments.

These creations don’t pretend to solve the world’s crises (AI bots will do so any day now, engineers say), nor do they aspire to technological perfection. Instead, they invite us to linger with texts, to enter into dialogue with systems, and to cultivate modes of knowing that resist capture.

In a moment when the humanities risk being reengineered into either instrumental usefulness or obsolescence, creative-critical practices perform a kind of quiet resistance. They insist that what matters in literature, and in humanistic inquiry more broadly, is irreducible not only to data, but to the very expectations of utility itself. It is here, in the space between creation and critique, that the future of digital humanities may yet find room to breathe.

Works Cited

Cabrerizo, A. S. (2025). “La ortodoxia en Humanidades Digitales”. REC-LIT Reciclajes culturales en la era postdigital, 31 de julio.

Mélanie-Becquet, F., Grunspan, C., Maignant, M., Plancq, C., & Poibeau, T. (2022). “The Oupoco Database of French Sonnets from the 19th Century”. Journal of Open Humanities Data, 8, 25.

Mélanie-Becquet, F., Plancq, C., Grunspan, C., Maignant, M., Raffard, M., Roussel, M., Ghedini, F., & Poibeau, T. (2024). “Exploring Combinatorial Methods to Produce Sonnets: An Overview of the Oupoco Project”. Digital Humanities Quarterly, 18(1).

Morozov, E. (2013). To Save Everything, Click Here: The Folly of Technological Solutionism. PublicAffairs.

Pereira, L. L. (2017). Máquinas do Desassossego = Machines of Disquiet.

Pereira, L. L., Portela, M., & Roque, L. (2018). “Machines of Disquiet: Textual Experience in the LdoD Archive”. MATLIT, 6(3), 59–71.

Poibeau, T. (coord.) (2018). Oupoco.

Portela, M. (2022). Literary Simulation and the Digital Humanities: Reading, Editing, Writing. Bloomsbury Academic.

Torres, R. (coord.) (2025). RECRIAÇÕES – Releituras da Poesia Experimental Portuguesa. Arquivo Digital da PO.EX, outubro de 2025.

 

Bruno Ministro

Digital Humanities Tools for Germanic Literary Studies: A Project Report by Dominika Anna Gortych and Cezary Rosiński

Dominika Anna Gortych, Adam-Mickiewicz-University, Poznań / Cezary Rosiński, Institute of Literary Research of the Polish Academy of Sciences, Poznań

The work carried out at the Digital Humanities Centre (Institute of Literary Research of the Polish Academy of Sciences) in the field of computational research within literature and culture has attracted the attention of scholars of various philologies, including Germanic philology (Instytut Filologii Germańskiej UAM). As part of my literary research on contemporary German literature, I submitted a project entitled Right-wing violence after 1989 in German prose: generationality and intersectionality to the National Science Centre (NCN). I received a decision on its financing in the summer of 2024.

The project aimed to examine how violence inspired by right-wing ideology is portrayed in contemporary literature, particularly prose describing the experiences of the younger generation in eastern Germany after 1989 — a period often referred to as the ‘Baseball Bat Years’ (Baseballschlägerjahre). The research aimed to confirm or refute the assumption that the stories of perpetrators dominate literary discourse today, while the experiences of victims, particularly those intersecting with other forms of exclusion (e.g. racism or sexism), remain marginalised.

To date, no research has been conducted that comprehensively addresses this topic by taking into account both perpetrators and victims of violence. Additionally, there has been an absence of a bibliography containing commentary that would facilitate the development of a contemporary body of literary works focusing on right-wing violence and enable a re-evaluation of existing research assumptions.

The project, therefore, involved creating a publicly accessible digital database that complies with FAIR principles. This database collects information about novels and short stories written since 1989 that address the issue of right-wing violence. The objectives were:

  • to collect a corpus of literary texts on this phenomenon;
  • to identify the ideological contexts of violence (e.g. neo-Nazism, racism and sexism) and its various forms (physical, psychological, verbal and sexual);
  • The authors of these texts were to be characterised, as were the conditions of their publication and reception (e.g. place of publication, type of publisher, awards received).

The whole programming code is publicly available in a GitHub repository. The README file is accessible here.

Stages of project implementation

I began the project with a week-long search at the Staatsbibliothek Berlin. Using the library’s resources, including its digital press archive, I compiled a list of 45 novels about right-wing violence since 1989 that have attracted the attention of literary critics and researchers. Based on my research, I compiled a list of 125 keywords that accurately reflected the phenomenon under study. I then grouped this catalogue according to the following provisional categories: name of historical event; place of event; terms/synonyms for violence; concepts describing social phenomena; right-wing extremism; post-migration; youth culture; and historical figures.

For the second stage of the research, I collaborated with Cezary Rosiński, who is a documentary specialist and data expert at the Current Bibliography Laboratory of the Polish Academy of Sciences. He is also a literary scholar and Python programmer. This opened the project up to digital humanities tools. Based on an existing catalogue of keywords, I commissioned Cezary to automatically search the available resources of perlentaucher.de, a digital archive containing information on most literary texts published in Germany, as well as advertising texts, novel summaries, and reviews. This gave us a list of 5,000 texts published after 1989 whose descriptions contained the aforementioned keywords. Such a rich collection required revision and reduction, which took place in the following steps: First, we marked the literary texts that had been selected on the basis of the preliminary query in Berlin, as well as a similar number of negative examples. Second, Cezary developed a Python code to identify further texts that corresponded to the project’s criteria. We obtained a list of 148 texts. However, as the code was only 80% accurate, we decided to verify the results (analysis of keywords assigned to each item, analysis of press reviews, and any available theoretical and literary studies). Ultimately, the corpus comprised 113 items.

The third stage of the research project involved creating an RDF (Resource Description Framework) database that stores represented information as triples — subject, predicate, and object — enabling semantic representation and processing of interconnected data in the Semantic Web. The triple structure allows you to store information about, among other things, authorship: Als wir träumten by Clemens Meyer (<https://example.org/rechtsextremismus/Text/n102> —  schema:author  —  <https://example.org/rechtsextremismus/Person/a75>), awards: Reinhard Jirgl awarded the Alfred-Döblin-Preis (<https://example.org/rechtsextremismus/Person/a16>  —  schema:award —<https://example.org/rechtsextremismus/Prize/pr62>) or scope of activity: Blumenbar Verlag with a reach of ‘local/independent’ (<https://example.org/rechtsextremismus/Organization/i8>  —  schema:areaServed  —   ‘local/independent’ ). Our resource contains bibliographical and research metadata as well as external identifiers, not only to ensure greater compliance with the FAIR principles, but also to encourage researchers to data- and metadata-driven research within literary studies. This database enables queries with SPARQL and Cypher languages for answering more sophisticated research questions. This purposefully designed information resource about literary texts was created through a series of automated activities on the website perlentaucher.de using digital humanities technologies, such as bibliographic data modelling using Linked Open Data (LOD), text mining with Natural Language Processing tools, and network analysis using NetworkX, combined with manual expert annotation to supplement information unavailable in external knowledge sources (e.g. perspectives on right-wing violence and the ideological contexts and types of violence). Unfortunately, we did not have digital versions of all literary texts. Therefore, we decided to analyse the information contained on the perlentaucher.de website, i.e. metadata for each novel, paratexts (publishing advertisements, or ‘Klappentexte’) and summaries of publishing reviews contained on the website. The following entities were defined and assigned appropriate attributes: [I] Literary text: title, date of publication, place of publication, publisher, genre; debut/subsequent novel; theme/perspective of the issue (generational, intersectional, or other), cause of violence, type of violence, keywords and reviews. [II] Person: first and last name, dates of birth and death, along with places of birth and death; gender, awards received, professions, and historical background. [III] Place: name and coordinates. [IV] Award: name and date. [V] Institution: name of publisher, date of establishment, and reach. Where possible, we assigned VIAF and Wikidata IDs to entities to enhance interoperability of the resource and to promote LOD. All automatically obtained results were reviewed. The database has been published under a CC BY 4.0 licence in open access in the Zenodo repository, and a copy has also been deposited in the AmuRed research data repository.

Project results

The corpus and database enable the tracking of relationships between issues, authors, and literary institutions, which contributes to the research’s innovative nature. The resource prepared in this way made it possible to answer an extensive set of research questions focusing on the analysis of literature on ‘rechte Gewalt’ (right-wing violence) in terms of quantity, time, content and literary forms, publications and distribution, and the role of visualisation in literary studies.

Number of books on right-wing violence per year, depending on perspective Number of books / Publication’s Year

Number of books on right-wing violence per year, depending on perspective
Number of books / Publication’s Year

Analysing the semantic relationships between the identified entities partially confirmed the hypothesis that narratives about right-wing violence in generational terms predominate in literary texts over those that allow for an intersectional approach to this issue. However, it should be noted that, since 2020, there has been a noticeable increase in the number of texts of the second type. Throughout the entire study period, texts were published that could not be assigned to any of the designated perspectives. However, based on the collected data, it was not possible to unequivocally revise the hypothesis about the predominance of interest from the perspective of perpetrators of violence. This is because even among texts describing violence as a generational experience, narratives from the perspective of victims were found. Furthermore, the collected data did not always allow the narrative perspective to be determined without insight into the literary text. Therefore, it is necessary to expand the study to include full literary texts (digital versions of all novels devoted to right-wing violence) as part of a larger project as part of a larger project to unequivocally verify the hypothesis.

However, the study allows us to draw interesting conclusions: [I] The origin of the authors is significant: – From a generational perspective, biographies related to the former GDR dominate. – From an intersectional perspective, those related to West Germans or people from outside the German-speaking area dominate. [II] ‘Generational’ texts more often associate violence with subcultures and politics, while intersectional texts associate it with racism and gender-based violence. [III] Texts from both groups are primarily published by large publishing houses, which testifies to the significance of this topic. Many of the authors are debutants, which also indicates the importance of this biographical experience. [IV] Crime and youth novels are popular, especially in a group of texts without a clear perspective. [V] Since 2015, keywords such as ‘racism’, ‘province’, ‘turning point’ and ‘violence’ have grown in popularity. The only keyword present throughout the entire period under study is ‘neo-Nazism’, indicating a direct link between violence motivated by right-wing ideology and the neo-Nazi subculture. In summary, right-wing violence is a recurring theme in German-language literature and, in recent years, it has increasingly been depicted in a broader, intersectional context.

The ten most popular keywords in novels about right-wing violence in the years 1990–2025 Keywords: violence, neo-Nazis, right wing, racism, reunification, GDR, provinces, NSU, right-wing extremism, conflict
The ten most popular keywords in novels about right-wing violence in the years 1990–2025
Keywords: violence, neo-Nazis, right wing, racism, reunification, GDR, provinces, NSU, right-wing extremism, conflict

The ten most popular keywords in novels about right-wing violence in the years 1990–2025
Keywords: violence, neo-Nazis, right wing, racism, reunification, GDR, provinces, NSU, right-wing extremism, conflict

In conclusion, this project has not only achieved its research goals but also established a replicable workflow that can serve as a model for future initiatives. By consciously creating reusable resources for the academic community and ensuring access to robust analytical tools, it responds to some of the most pressing needs in contemporary literary studies. Such an approach fosters openness, collaboration, and methodological innovation—values that are essential for the continued growth and relevance of the discipline.

 

Dominika Anna Gortych and Cezary Rosiński

La ortodoxia en Humanidades Digitales, por Amelia Sanz (UCM)

Universidad Complutense de Madrid (amsanz@ucm.es)

De vuelta de dos magnos acontecimientos en el campo de las Humanidades Digitales, el encuentro anual de DARIAH. The Past  (Göttingen, 17-20 junio 2025) y la conferencia internacional de la ADHO (Alliance of Digital Humanities Organization), DH 25. Accessibility and Citenzenship (Lisboa, 14-18 julio 2025), se me ocurre compartir algunas sorpresas y varias reflexiones en el terreno de las literaturas.

De entrada, sorprende cómo circulan los vientos de las modas digitales: ya no interesan ni el topic modeling, ni el sentiment analysis más allá de ser ejercicios de destreza para aprendices. Lo estandarizado en cualquier propuesta de herramientas es el corpus mining (concordancias, colocaciones, frecuencia de lemas y sus formas, CQL), los quantitative and static models para modelos de géneros literarios, el GIS (sistemas de geolocalización)…

Es lo que enseña una iniciativa grande como es HERMES (Humanities Education in Research, Data, and Methods) en Alemania, o de forma más centrada PANDORE Toolbox construida por el laboratorio OBTIC de la Universidad  Sorbonne en Francia como trayectoria posible para una investigación digital, como también  hace para muy diversas materias DARIAH-TEACH (basada en MOODLE) que, por cierto, va a ser absorbida por DARIAH-CAMPUS por dificultades de mantenimiento.

Lo que se puede hacer con metodologías digitales en el ámbito de las literaturas, lo encontramos en CLS-INFRA (Computational Literary Studies Infrastructure), un proyecto Horizon 2020 que finaliza en julio 2025 y propone compartir herramientas y datos para el estudio de la literatura en la era digital, si bien sorprende,  por ejemplo, que toda la base teórica sobre literary history  ocupe una página y 20 referencias bibliográficas desde 2012 a 2022. Los corpus de calidad que proponen provienen de la COST Action  ELTEC: 12 corpus en 12 lenguas europeas con 100 novelas por lengua entre 1840 y 1920, aunque las selecciones hayan respondido a criterios muy diferentes en cada caso.

Otros proyectos que pueden marcar una pauta hoy son GOLEM (Graphs and Ontologies for Literary Evolution Models), una ERC de 2023 a 2027 que propone crear modelos precisos de difusión y combinación de rasgos culturales (formales y de contenido) de la ficción, a partir de datos obtenidos de relatos de (fan)ficción en cinco idiomas (inglés, español, italiano, coreano e indonesio). También ModERN (Modelling Enlightenment. Reassembling Networks of Modernity through data-driven research), otra financiación ERC que propone una nueva historia literaria de las Lumières francesas a partir de todos los corpus digitalizados existentes en francés correspondientes a ese periodo histórico: 13.121 volúmenes de 3.238 autores, a lo que añade 26.516 panfletos, 49.293 cartas, 27.888 volúmenes de prensa, y 6 diccionarios, incluyendo la Encyclopédie entera.  Así es posible verificar que “intelligence” en francés tiende a significar la habilidad para sacar partido de las circunstancias con ingenio y eficacia gracias a una conducta determinada a principios del S. XVIII, para ser usada mayoritariamente como función mental para la organización de lo real a finales de ese mismo siglo.

Desde ese tipo de proyectos, llueven los consejos, por ejemplo sobre el uso de la Inteligencia Artificial: utilicen LLM medianos como BERT, no dependan de un LLM comercial único, comiencen siempre con un modelo pre-entrenado, no empiecen de cero…

Y por ahí se nota una obsesión por juntar en grandes silos  colecciones/datos que resulten accesibles para los investigadores y, sobre todo, atractivos para los informáticos que buscan  big big data también en Humanidades: ahí está TEXT+, el gran consorcio alemán desde 2021 para el mantenimiento a largo plazo de colecciones, recursos léxicos y ediciones, o en el ámbito del patrimonio cultural en general, iniciativas como el Common European Data Space for Cultural Heritage o  la cascada de financiación de proyectos de digitalización que viene de ECHOES desde la Unión Europea y su propuesta de un European Collaborative Cloud for Cultural Heritage.

Tendríamos que analizar con cuidado si la digitalización masiva está modificando el canon literario o lo está debilitando; si realmente la búsqueda de similaridades con IA puede responder a preguntas esenciales de la narratología, pero será en otros momentos.

Porque sucede que los ordenadores son literalistas: cuentan letras. Si se trata de contar nodos de genealogías en papiros o en piedras, lo hacen muy bien, pero si de contabilizar conceptos (filosóficos, culturales, narratológicos) se trata, esas modelizaciones presentan problemas que han sido evocados una y otra vez en estas conferencias, sin mayor profundidad por cierto. Segmentar textos literarios: ¿dónde y cuándo termina una escena, un personaje que habla, un personaje que escucha? La canonicidad, la periodización, la interseccionalidad: ¿cómo las operacionalizamos?   ¿Y cómo hacer cuando un análisis computacional identifica un rasgo, pero un investigador lo critica y otro lo descarta y uno más lo niega, y siempre desde distintas premisas? Además, para el reconocimiento de modelos se necesitan entrenamientos, esto es, identificación, anotación, marcado, que de entrada son manuales, pero ¿hasta dónde llevar la granularidad? Más aún: el problema viene cuando el campo léxico-semántico de la tristeza está ausente, pero es un día de lluvia o unos eventos tristes producen alegría en el lector.

Muy pocos se atreven a decir alto y claro (solo los que pintan canas, porque ellas les valen una reputación que ya es indiscutible, y no citaré nombres), por ejemplo, “ya tengo 250.000 entradas de la biblioteca nacional, ¿y ahora qué?”, o “en esta conferencia falta explicitación del origen de los datos utilizados”, o “ya tengo mi ontología, pero ni la he podido publicar ni nadie me la ha pedido, ¿alguien sabe de alguna ontología que haya sido reutilizada o fusionada?”.  Silencio absoluto en una sala repleta: ni una sola respuesta.  Escuché una sola referencia a las Critical Digital Humanities. Sólo desde Hispanoamérica preguntaron para quiénes, en lugar de para qué.

En contraste, los jóvenes (tampoco diré nombres) se exaltan y les oímos decir “Draw the past. Let AI explain it”, “I am an empirist first, theorising comes later”, “any literary concept should be operationalized and checked”. Son citas textuales, no son recuerdos.

Y es que escuchamos apelaciones sin tregua al distant reading de Franco Moretti, pero ni una sola alusión escuché a su última obra, Falso movimiento. El giro cuantitativo en el estudio de la literatura (2023, 2022 para su primera edición en italiano), donde precisamente critica el alejamiento de las metodologías digitales de las preguntas teóricas básicas que hacemos desde la historia y la crítica literarias.

Más aún, el lema “epistemología” en cualquiera de sus declinaciones morfológicas apareció en muy contadas ocasiones y en voces provenientes de la filosofía (o ésta que suscribe) sin que nadie se atrevería a pronunciarla de nuevo.  De hecho, fueron contados (recuerdo solo dos) los investigadores (nótese: investigadores) que presentaron sus bases teóricas en la historiografía en primer lugar de su exposición. Lo que todos desplegaban era su metodología, y si algún paso quedaba poco explícito, las voces de la sala se alzaban en el turno de preguntas.

Sin embargo, sí aparecía el lema “ética” en todas sus categorías gramaticales: los principios FAIR (Findablity, Accessibility, Interoperability, Reusability) o  CARE (Collective Benefit, Authority to Control, Responsibility, Ethics for Indigenous Data Governance). Muchas voces lo señalaban: archivos accesibles sí, pero no por ello utilizables, utilizados.

Y es que sí se nota preocupación ética, tanto que aparecen iniciativas por todas partes:  desde APA, Best practices for use of generative AI in Documentaries  a  BBC, Guidance: The use of Artificial Intelligence, en artículos como “Working Paper: Implementing Generative AI in the Historical Studies”,  o el próximo white paper  que nos promete el grupo de trabajo ELDAH en el marco de DARIAH: “Ethics in practice: a collaborative framework for research integrity in the DH”.

Llegados a este punto me pregunto, ¿qué pasa cuando la historia literaria se “traduce” (se “operacionaliza”) en Digital Humanities, y cuando después los productos de las Digital Humanities se “traducen” en otra historia literaria? ¿Cómo es ese fenómeno de refracción sucesiva? ¿Cómo medimos ese ángulo de inclinación, esto es, esa nueva producción de sentido? La pluralidad siempre interesa porque es posible, lo que aterra es la nueva verdad única.

La ciencia es heterodoxa o no es.

Amelia Sanz Cabrerizo