blog · · 3,051 words · 13 min · es
La IA no necesita censurarte. Solo necesita que desaparezcas.
......................................... -#........................................................ .........................................:@* ....................................................... ........................................ +*#: ....... ............................................. ........................................ =#:#=. ....... ............................................ ................................... .... #-.+#: .....+- ........................................... ..................................... ...=# .-%-.... =@:........................................... ....................................+*... #+..:=# . :#@- .......................................... ................................... -@* .**.. :-% :+*=#......... ................................. .................................. #+#-#*:... *+ -#= +* . .....=. ................................ ................................. .#+.%%=:... -%..%=:.=% *: ....*%................................. .......................... .... -#= -@=:.....#+ .%:.. +#=@#... *@+ ............................... ...........................: .. =%-..:@-. .:#@-=@- .. -%:+*. .**=# ... .......................... ...........................*+...%-:.. -:..:..--#@@*... . -% =#= %- .. -: ......................... .......................... =@-..%-:. ..-#..:::. ..=: ..:**=#- +# . .+% .......................... ...........................##* %-:.=.... =@= ..... *# .:-@=%-:.#+ .- #%: ......................... ..........................#=.%**#.. *+ . =##=.. . .=@+ .:=@@@...-%:-@-:*#:......................... ........................ -%...==. :@= .**:%..... =+#+...:-*#=.. -**=% .@-......................... .........................:@-. ..-##..#+..%: .. =+=+ .. .. .-+....=%.:+. ....................... ....................... +@+:....#:#..%.- :+:.. +:*= +- ... -@-..:%: . :........................ .......................*####*=. ==-+=%+:. .....-:*=-=##....-++: -@++..=% ....................... ..................... :%----==++==-==-::--. .... ::::. .:----===#@+ .%@- ...................... ......................++.. ..:--==+++===--:.. ...::-==++++++==-:%-.: #=#- ..................... ..................... =*.. .. ..::-==+**++++***++==-::.. .:% .%+%::%:..................... ......................:%+-:... ... ===#*==--:::...........:%:.##-.:*+..................... .....................#@#*+**+++=--:. :+==%--::::.. ....::--==*%*-:...%= .................... ......................=#-==+=***####**+=-::..===%-:::::--==++++++++++++*%@=.*#... .................. ..................... %: +* .::-=+**#%%%#*##*##+++++++======+++++==-:%-.#+ =#................... .................. +* :%. :%#: ...:-==+**###*+--=++++++=-:..- :% -@::=#@: ................. .................. ##*%*--:=*:#- ... .++%*+=--::... .@= .#-.=**=:%................... .................. *+.--#@%@= :@==-:.. .....-+=#::::::.... :**#=+*@+.. .%= .................. .................. #+ -#.*+ .*#######*+==-::... .-=+*::::::--==*#:.%*++*@%.=%- .. ................ ..................+= %-*=:* .*= ..::-=++*#####**+==-*=%+++***++++%* +#=-=#.-%. =*.................. ................. =@*%-#==+ :#... .::-=++*##*#*#*++++++++=-#:.#:..*+ #%.=@#.................. ................. ++-- -#=#..*: ...... ..*-:-**#+++=--:..:#:.=...=# :#%#:+* ................ ..................%: .=-=+*+=**=-::. ..... =* ==%=-:::.....-. .:-=##- . +# ................ ..................%- :@+=+++++++**+++=--:.. ++..++#::::::....:-==++++++*%%-.+%:................. ................. =%- -* ..::--===++*******+=-:.-*. +=#::::--=+++++++++++++=%--#+. ................. .................. -#++# . ....::-==+*#####%*+*+%+++++++===++++=-::..=# @#:=.................. ................... :*@=.. .. ..::-=+*##%%%+===+++++=-:.......-%.-*+-.................. .................. +#*#%###*=-:.. .... ..:=+*%++=-::..........:-##=:: .................. ................. :%. :+=*=*#%%%#*+=--:.. ..... +:#=::::::....:-==++**+*#@#................... ..................+* .+:+. .:-=+**####*+=--::... .+:%:-::::-==++********+=#+ ................... ................. =# +:* ... ..:-=++**#***++==-:*-#+==++*******++==-:. %:.................... ..................:%+-+-+ ..... ..:-=+*****+*+*#******++=-::. ...:%: ................. .................::=*###%*=-:. ...... .+-*-==+*++**++=-::............+#+:.................. ................ ....:-=*####*+=-:. .....-=+: ++%+=--:::.........:-=+**##-:................. .................... ...:-=+*####*+-:.. =-+...:+#+::::::.....:-=+*###*+-:... ................ ........................ ....:-=+*####*+=-.=-+. -+#=:::::::-=+*###*+=-:. .................. .............................. ....::-=+*######=:.:=*+:--=+**##*+=-:... ....................... ................................... ....::-=+*###*##@**###+=-:.. ........................... ......................................... . ..:--=+++=-:.. ................................
cat /alexandria, No such file or directoryCensurar solía necesitar un censor. Alguien que quemara un libro, alguien que reescribiera un libro de texto, alguien que llamara a la imprenta.
Ya no. En la web mediada por IA, alcanza con desaparecer del índice.
el modelo es la nueva portada
Durante veinte años, leer la web significaba abrir una página. Escribías una búsqueda, te salían diez links azules, hacías clic en uno.
Ahora le preguntás a un modelo. El modelo lee por vos y te cuenta qué hay. La página en sí es algo que casi nunca ves. La gente habla más con ChatGPT, Claude, Perplexity y Gemini que con la fuente de la información. El autor que escribió el texto, el sitio que lo aloja, el periodista que hizo la nota, todos quedan una capa por debajo de una ventana de chat que la mayoría de los lectores nunca abandona.
Esto suena a un cambio de UX. No lo es. Es un cambio de sustrato. Una vez que una página no está en el set de entrenamiento ni en el índice de recuperación, deja de existir para el lector promedio. No “más difícil de encontrar”: no existe. El lector no sabe qué no preguntó, y qué no le contaron.
Lo mismo le pasó a los catálogos de fichas, a las guías telefónicas, a los RSS. Ninguna de esas capas se borró, simplemente dejó de ser la capa que alguien consultaba. Después de un tiempo, “ya no se consulta” se convierte en “ya no es real.”
la IA superó a la escritura humana en noviembre de 2024
Esto no importaría mucho si el corpus subyacente siguiera siendo representativo de la escritura humana. No lo es.
Graphite analizó 65.000 artículos en inglés de Common Crawl, muestreados mes a mes desde enero de 2020 hasta mayo de 2025, con el detector de IA de Surfer. Los artículos generados por IA superaron a los escritos por humanos en noviembre de 2024 y llegaron al 51,7% en mayo de 2025.1
Una salvedad que vale la pena aclarar: solo cerca del 14% de los artículos que rankean en Google Search están generados por IA, según el mismo estudio.1 El volumen de publicación no es lo mismo que la visibilidad. Pero los corpus de entrenamiento se construyen a partir del volumen de publicación, no de los rankings de búsqueda. El modelo ve la basura. El lector ve el frente curado.
La web no se está achicando. Se está adelgazando. Más tokens, menos señal.
el modelo se entrena consigo mismo
Cuando un modelo se entrena mayormente con el output de modelos anteriores, las colas raras de la distribución original desaparecen primero.
Shumailov et al. publicaron esto en Nature en 2024 bajo un título que no se anda con vueltas: AI models collapse when trained on recursively generated data.2 No el centro popular: los bordes. Dialectos de nicho. Opiniones minoritarias. El único historiador que discrepaba del consenso. El post que nadie enlazó pero que resultó tener razón.
Cada generación se come su propia cola. La cola larga es la primera en irse.
Llamemos a esto olvido recursivo. No es malicioso. Ni siquiera es un bug. Es la geometría de entrenar sobre una distribución que ya no coincide con la realidad. Y se proyecta que la proporción de input sintético de entrenamiento va a dominar para fines de la década: Gartner proyectó que los datos sintéticos van a superar a los datos reales en el entrenamiento de IA para 2030.3
Después de suficientes ciclos, la visión del mundo del modelo converge hacia su propio prior. Lo que quedaba fuera de ese prior ya no es alcanzable, sin importar cuán cierto haya sido.
el uno por ciento de la literatura clásica sobrevivió al último índice
Ya vimos esto antes, en una escala temporal más lenta.
Aproximadamente el 1% de la literatura griega y latina clásica sobrevivió hasta hoy.4 De las cerca de trescientas tragedias atenienses conocidas por su nombre, treinta y dos textos completos llegaron hasta nosotros. La causa, contrario al relato de manual escolar, casi nunca fue un solo incendio. La Biblioteca de Alejandría no cayó en una sola noche. Fueron decisiones de indexación, prioridades de copiado, cambios de gusto, fallas de almacenamiento, acumulándose durante siglos. Los textos que no se volvieron a copiar no sobrevivieron. Los textos que no se tradujeron no se volvieron a copiar.
La supervivencia se determinaba río arriba de cualquier lector. Era función de qué texto un escriba consideraba que valía su semana.
La misma maquinaria está corriendo otra vez. Distintos escribas.
la mayoría de los libros jamás escritos no están en ningún modelo
Antes incluso de llegar a la pregunta de indexación, hay una más aburrida: gran parte de la escritura humana simplemente no está digitalizada.
Google estimó en 2010 que había cerca de 130 millones de títulos de libros distintos en el mundo.5 Quince años después, Google Books escaneó cerca de 40 millones; HathiTrust, el espejo académico abierto más grande, tiene cerca de 18 millones de volúmenes.6 Contando el solapamiento, bastante menos de un tercio de todo lo publicado alguna vez está en algún corpus digital del que un LLM pueda entrenarse.
El resto está en bibliotecas físicas, sótanos universitarios, colecciones privadas. Para un modelo, no es solo difícil de acceder: no existe. El argumento del autor se planteó, el libro se publicó, y el modelo nunca escuchó de él.
La mayor parte del conocimiento humano, desde la perspectiva del modelo, ya desapareció.
el archivo tiene el espesor de una sola demanda judicial
La parte más delgada del corpus también es frágil.
En junio de 2024, el Internet Archive eliminó cerca de 500.000 libros de su Open Library tras perder Hachette v. Internet Archive en primera instancia.7 En septiembre de 2024, la Cámara de Apelaciones del Segundo Circuito confirmó el fallo.8 Uno de los archivos digitales sin fines de lucro más grandes del mundo perdió medio millón de títulos por una sola sentencia.
El Internet Archive es una sola organización. La Wayback Machine, el único registro significativo de cómo solía verse la web abierta, depende del mismo presupuesto sin fines de lucro, de la misma exposición legal, del mismo punto único de falla. No existe un segundo archivo de la misma escala.
Si el próximo fallo va en el mismo sentido, o llega el abismo de financiamiento, o se inunda el edificio, ese registro se va con eso. El modelo no necesita que le avisen que los libros desaparecieron. Simplemente dejan de estar en la próxima corrida de entrenamiento.
censura sin censor
Juntá estos hilos y aparece un patrón más silencioso.
No hace falta prohibir un libro. Solo hace falta mantenerlo fuera de un puñado de fuentes clave antes del próximo ciclo de entrenamiento. No hace falta silenciar a un escritor. Solo hace falta mantener su sitio fuera del índice. No hace falta reescribir la historia. Solo hace falta esperar a que la cola larga se adelgace, y dejar que la recursividad haga el resto.
Esto es censura en el sentido matemático: una reducción del soporte de la distribución, sin nada que se parezca a un censor. Sin incendio, sin lista de libros prohibidos, sin villano público. Solo una decisión de indexación, propagada.
Y como todo esto pasa río arriba del lector, el lector no se puede dar cuenta. No notás los libros que no están en el estante cuando nunca viste el estante.
cuatro modelos leen por todos
No hace falta que falte la mayor parte del contenido del mundo. Solo hace falta que falte en tres o cuatro modelos.
La gente usa lo que es bueno y conveniente. El ranking de LMArena está dominado por un puñado (GPT, Claude, Gemini, Grok) y los siguientes treinta son notas al pie para aficionados. Si le haces una pregunta real a una persona real este año, la respuesta casi seguro pasó por uno de esos cuatro modelos.
La concentración es el multiplicador. Si tu trabajo no está en el corpus con el que se entrenaron esos cuatro, o cae por debajo de su umbral de relevancia, el lector promedio de 2030 nunca lo va a encontrar, aunque la página siga existiendo, aunque Common Crawl todavía tenga una copia en algún lado. El embudo es angosto a propósito. Los modelos mejores cuestan más entrenar y servir. La economía empuja hacia unos pocos ganadores. Los pocos ganadores eligen qué sobrevive.
qué significa esto para tu trabajo
Si escribís en internet hoy, estás compitiendo por un lugar en la visión del mundo de un puñado de modelos. La mayor parte de lo que se publica no consigue ninguno.
El post de Substack que escribiste en marzo pasado. El sitio de Notion sobre tu startup. El ensayo de LinkedIn que hizo 200 likes. Es probable que tu trabajo no desaparezca: a la mayoría eventualmente la rastrean. Lo que pasa es más difícil de combatir: se diluye en un mar de contenido redactado por IA escrito alrededor de los mismos prompts. El modelo sabe que escribiste algo. Simplemente no te pondera por encima del ruido.
Y si directamente no llegás al próximo ciclo de entrenamiento, o llegás pero te bajan de ponderación al fondo, el efecto práctico es el mismo que si nunca hubieras publicado. El lector que le pregunta al modelo nunca se entera de que lo escribiste vos.
No puedes controlar el índice. Puedes controlar qué pones en él, y con qué frecuencia. O estás en el índice, o ya eres invisible.
un registro, por las dudas
La probabilidad de que este mismo post sobreviva la próxima década en la visión del mundo de algún LLM no es cero. Pero tampoco es uno.
Tampoco lo es la tuya.
Este blog es una pequeña apuesta contra el borrado, un lugar para dejar lo que pienso y lo que piensa la gente que admiro, en URLs estables, espejado, alimentado al índice, para que alguna versión tenga una chance de llegar a lo que sea que estén usando los lectores de 2035.
No creo que internet tenga que morir. La biblioteca se puede reconstruir, mejor esta vez, porque sabemos qué está en juego. Esto es un desafío para resolver, no un destino para aceptar.
El resultado por default es el borrado. La excepción es lo que elegís poner en el índice, y con qué frecuencia. Escribí lo tuyo. Publicalo en algún lugar estable. Espejalo.
Footnotes
-
Graphite, More Articles Are Now Created by AI Than Humans, oct. 2025, n = 65.000 artículos en inglés de Common Crawl, ene. 2020, mayo 2025, analizados con el detector de IA de Surfer. La cifra del 14% de visibilidad en Google Search es del mismo estudio. ↩ ↩2
-
Shumailov, I., Shumaylov, Z., Zhao, Y., Papernot, N., Anderson, R. & Gal, Y. AI models collapse when trained on recursively generated data. Nature 631, 755-759 (2024). ↩
-
Gartner viene proyectando desde hace varios años que los datos sintéticos van a superar a los datos reales en el entrenamiento de IA para 2030. Hito anterior: Gartner (2021) proyectó que el 60% de los datos de IA/analítica serían generados sintéticamente para 2024. ↩
-
Estimación académica estándar (ver Reynolds & Wilson, Scribes and Scholars), aunque discutida en cuanto al método. De ~300 tragedias atenienses conocidas por su nombre, sobreviven 32 textos completos. ↩
-
Leonid Taycher, “Books of the world, stand up and be counted! All 129,864,880 of you,” blog de Google Books, agosto de 2010. ↩
-
Google Books reportó más de 40 millones de escaneos en su quinceavo aniversario, en octubre de 2019. HathiTrust reportó más de 18 millones de volúmenes en septiembre de 2024. ↩
-
Blog del Internet Archive, “Let Readers Read,” 17 de junio de 2024, cita la cifra de ~500.000 libros eliminados de CDL tras la victoria de las editoriales en el tribunal del Distrito Sur de Nueva York (SDNY). ↩
-
Hachette Book Group, Inc. v. Internet Archive, No. 23-1260, 2do Circuito, 4 de septiembre de 2024 (confirma el fallo del SDNY). ↩