lautaro@wilsf · bash · ~/pt/blog/future-ai/the-quiet-erasure

Tradução automática do inglês · ler o original

blog · · 2,961 words · 13 min

A IA não precisa te censurar. Ela só precisa que você desapareça.

......................................... -#........................................................
.........................................:@* .......................................................
........................................ +*#: .......  .............................................
........................................ =#:#=. ....... ............................................
...................................  .... #-.+#: .....+- ...........................................
.....................................  ...=# .-%-.... =@:...........................................
....................................+*... #+..:=# .  :#@- ..........................................
................................... -@* .**.. :-%  :+*=#.........  .................................
..................................  #+#-#*:... *+ -#= +* .  .....=. ................................
................................. .#+.%%=:... -%..%=:.=%  *: ....*%.................................
..........................  .... -#= -@=:.....#+ .%:.. +#=@#...  *@+ ...............................
...........................: .. =%-..:@-.   .:#@-=@- .. -%:+*. .**=# ...  ..........................
...........................*+...%-:.. -:..:..--#@@*... .   -% =#= %- .. -: .........................
.......................... =@-..%-:.    ..-#..:::. ..=: ..:**=#- +# . .+% ..........................
...........................##*  %-:.=.... =@= .....  *# .:-@=%-:.#+ .- #%: .........................
..........................#=.%**#.. *+ . =##=..  . .=@+ .:=@@@...-%:-@-:*#:.........................
........................ -%...==.  :@= .**:%..... =+#+...:-*#=..  -**=% .@-.........................
.........................:@-.   ..-##..#+..%: .. =+=+ ..  ..  .-+....=%.:+.  .......................
.......................   +@+:....#:#..%.- :+:.. +:*=   +- ... -@-..:%: .  :........................
.......................*####*=.   ==-+=%+:.  .....-:*=-=##....-++:  -@++..=% .......................
..................... :%----==++==-==-::--.     .... ::::.  .:----===#@+ .%@- ......................
......................++..    ..:--==+++===--:..   ...::-==++++++==-:%-.: #=#- .....................
..................... =*..   ..       ..::-==+**++++***++==-::..   .:% .%+%::%:.....................
......................:%+-:...      ...      ===#*==--:::...........:%:.##-.:*+.....................
.....................#@#*+**+++=--:.        :+==%--::::..  ....::--==*%*-:...%= ....................
......................=#-==+=***####**+=-::..===%-:::::--==++++++++++++*%@=.*#... ..................
.....................  %:   +* .::-=+**#%%%#*##*##+++++++======+++++==-:%-.#+  =#...................
.................. +* :%.  :%#:        ...:-==+**###*+--=++++++=-:..-  :% -@::=#@: .................
.................. ##*%*--:=*:#-      ...          .++%*+=--::...  .@= .#-.=**=:%...................
.................. *+.--#@%@= :@==-:..        .....-+=#::::::.... :**#=+*@+.. .%= ..................
..................  #+ -#.*+ .*#######*+==-::...  .-=+*::::::--==*#:.%*++*@%.=%- .. ................
..................+= %-*=:* .*= ..::-=++*#####**+==-*=%+++***++++%*  +#=-=#.-%. =*..................
................. =@*%-#==+ :#...        .::-=++*##*#*#*++++++++=-#:.#:..*+ #%.=@#..................
................. ++-- -#=#..*:    ......      ..*-:-**#+++=--:..:#:.=...=# :#%#:+* ................
..................%: .=-=+*+=**=-::.      ..... =*  ==%=-:::.....-.   .:-=##- .  +# ................
..................%- :@+=+++++++**+++=--:..     ++..++#::::::....:-==++++++*%%-.+%:.................
................. =%- -* ..::--===++*******+=-:.-*. +=#::::--=+++++++++++++=%--#+. .................
.................. -#++# .       ....::-==+*#####%*+*+%+++++++===++++=-::..=# @#:=..................
................... :*@=..       ..        ..::-=+*##%%%+===+++++=-:.......-%.-*+-..................
.................. +#*#%###*=-:..       ....       ..:=+*%++=-::..........:-##=:: ..................
................. :%. :+=*=*#%%%#*+=--:..       ..... +:#=::::::....:-==++**+*#@#...................
..................+* .+:+.   .:-=+**####*+=--::...   .+:%:-::::-==++********+=#+ ...................
................. =#  +:* ...      ..:-=++**#***++==-:*-#+==++*******++==-:.  %:....................
..................:%+-+-+     .....       ..:-=+*****+*+*#******++=-::.   ...:%:   .................
.................::=*###%*=-:.      ......     .+-*-==+*++**++=-::............+#+:..................
................  ....:-=*####*+=-:.      .....-=+:   ++%+=--:::.........:-=+**##-:.................
....................    ...:-=+*####*+-:..     =-+...:+#+::::::.....:-=+*###*+-:... ................
........................     ....:-=+*####*+=-.=-+.  -+#=:::::::-=+*###*+=-:.     ..................
..............................    ....::-=+*######=:.:=*+:--=+**##*+=-:...   .......................
...................................     ....::-=+*###*##@**###+=-:..     ...........................
.........................................      . ..:--=+++=-:..     ................................
fig 0. cat /alexandria, No such file or directory

Censura costumava precisar de um censor. Alguém queimando um livro, alguém reescrevendo um livro didático, alguém ligando para a gráfica.

Não precisa mais. Na web mediada por IA, desaparecer do índice já basta.

o modelo é a nova página inicial

Por vinte anos, ler a web significava abrir uma página. Você digitava uma busca, recebia dez links azuis, clicava em um.

Agora você pergunta a um modelo. O modelo lê por você e te diz o que existe. A página em si é algo que você quase nunca vê. As pessoas conversam mais com ChatGPT, Claude, Perplexity e Gemini do que com a fonte da informação. O autor que escreveu, o site que hospeda, o jornalista que apurou: tudo isso fica uma camada abaixo de uma janela de chat que a maioria dos leitores nunca sai.

Isso parece uma mudança de UX. Não é. É uma mudança de substrato. Uma vez que uma página não está no conjunto de treino nem no índice de recuperação, ela deixa de existir para o leitor mediano. Não “mais difícil de achar”: sumiu. O leitor não sabe o que deixou de perguntar, e não recebeu resposta sobre isso.

O mesmo aconteceu com os catálogos de fichas, com as listas telefônicas, com o RSS. Cada camada não foi apagada, só parou de ser a camada que alguém consultava. Depois de um tempo, “não é mais consultado” vira “não é mais real.”

a IA ultrapassou a escrita humana em novembro de 2024

Isso não importaria muito se o corpus subjacente continuasse representativo da escrita humana. Não continua.

A Graphite avaliou 65 mil artigos em inglês do Common Crawl, amostrados mensalmente de janeiro de 2020 a maio de 2025, com o detector de IA da Surfer. Os artigos gerados por IA ultrapassaram os artigos escritos por humanos em novembro de 2024 e chegaram a 51,7% em maio de 2025.1

Conteúdo de IA vs. humano na web, 2020–2025 Artigos gerados por IA ultrapassaram os escritos por humanos em novembro de 2024, chegando a 51,7% em maio de 2025, segundo análise da Graphite sobre 65 mil artigos do Common Crawl. 0% 25% 50% 75% 100% 2020 2021 2022 2023 2024 2025 ChatGPT · nov 2022 cruzamento · nov 2024 IA · 52% Humano · 48%
% de novos artigos na web gerados por IA vs. escritos por humanos. Fonte: Graphite, out. 2025 · n = 65.000 artigos do Common Crawl avaliados com o detector de IA da Surfer.

Uma ressalva que vale a pena manter honesta: apenas cerca de 14% dos artigos que rankeiam no Google Search são gerados por IA, segundo o mesmo estudo.1 Volume de publicação não é a mesma coisa que visibilidade. Mas os corpora de treino são construídos a partir do volume de publicação, não dos rankings de busca. O modelo vê o slop. O leitor vê a vitrine curada.

A web não está encolhendo. Está ficando mais rala. Mais tokens, menos sinal.

o modelo está se treinando em si mesmo

Quando um modelo é treinado majoritariamente sobre a saída de modelos anteriores, as caudas raras da distribuição original desaparecem primeiro.

Shumailov et al. publicaram isso na Nature em 2024 sob um título que não enrola: AI models collapse when trained on recursively generated data.2 Não o meio popular: as bordas. Dialetos de nicho. Opiniões minoritárias. O único historiador que discordava do consenso. O post que ninguém linkou mas por acaso estava certo.

Cada geração come a própria cauda. A cauda longa vai primeiro.

Chame isso de esquecimento recursivo. Não é malicioso. Nem é um bug. É a geometria de treinar sobre uma distribuição que já não corresponde à realidade. E a fatia de dados de treino sintéticos deve dominar até o fim da década: o Gartner projetou que dados sintéticos vão ofuscar dados reais no treinamento de IA até 2030.3

Dados sintéticos vs. reais no treinamento de IA, 2020–2030 (direcional) Prevê-se que dados sintéticos vão ofuscar dados reais no treinamento de modelos de IA até 2030. Dados reais crescem de forma aproximadamente linear; dados sintéticos crescem de forma aproximadamente exponencial. 2020 2022 2024 2026 2028 2030 Dados usados para IA → IA de hoje IA do futuro Sintético Real
Direcional, não medição. Padrão baseado na projeção do Gartner de que dados sintéticos vão ofuscar dados reais no treinamento de IA até 2030.

Depois de ciclos suficientes, a visão de mundo do modelo converge para o próprio prior. O que estava fora desse prior deixa de ser alcançável, não importa o quanto fosse verdadeiro.

um por cento da literatura clássica sobreviveu ao último índice

Já vimos isso antes, numa escala de tempo mais lenta.

Aproximadamente 1% da literatura grega e latina clássica sobreviveu até hoje.4 De cerca de trezentas tragédias atenienses conhecidas pelo nome, trinta e dois textos completos chegaram até nós. A causa, ao contrário da narrativa de livro didático escolar, quase nunca foi um único incêndio. A Biblioteca de Alexandria não caiu numa única noite. Foram decisões de indexação, prioridades de cópia, mudanças de gosto, falhas de armazenamento, se acumulando ao longo de séculos. Os textos que não foram recopiados não sobreviveram. Os textos que não foram traduzidos não foram recopiados.

A sobrevivência foi determinada rio acima de qualquer leitor. Era função de quais escribas achavam que um texto valia a semana deles.

A mesma máquina está rodando de novo. Escribas diferentes.

a maioria dos livros já escritos não está em nenhum modelo

Antes mesmo de chegar na questão da indexação, existe uma pergunta mais básica: boa parte da escrita humana simplesmente não está digitalizada.

O Google estimou em 2010 que existiam cerca de 130 milhões de títulos de livros distintos no mundo.5 Quinze anos depois, o Google Books escaneou aproximadamente 40 milhões; o HathiTrust, o maior espelho acadêmico aberto, guarda cerca de 18 milhões de volumes.6 Contando a sobreposição, bem menos de um terço de tudo que já foi publicado está em algum corpus digital em que um LLM possa treinar.

O resto está em bibliotecas físicas, porões de universidades, coleções particulares. Para um modelo, esses livros não são apenas difíceis de acessar: eles não existem. O argumento do autor foi feito, o livro foi publicado, e o modelo nunca ouviu falar dele.

A maior parte do conhecimento humano, do ponto de vista do modelo, já se foi.

o arquivo tem a espessura de um único processo judicial

A parte rala do corpus também é frágil.

Em junho de 2024, o Internet Archive removeu cerca de 500 mil livros de sua Open Library depois de perder o caso Hachette v. Internet Archive na primeira instância.7 Em setembro de 2024, o Segundo Circuito confirmou a decisão.8 Um dos maiores arquivos digitais não comerciais do mundo perdeu meio milhão de títulos por uma única sentença.

O Internet Archive é uma única organização. A Wayback Machine, o único registro relevante de como a web aberta costumava ser, depende do mesmo orçamento sem fins lucrativos, da mesma exposição jurídica, do mesmo ponto único de falha. Não existe um segundo arquivo da mesma escala.

Se a próxima decisão judicial for na mesma direção, ou o precipício de financiamento acontecer, ou o prédio alagar, esse registro vai junto. O modelo não precisa que lhe digam que os livros sumiram. Eles simplesmente deixam de estar na próxima rodada de treino.

censura sem censor

Junte esses fios e um padrão mais silencioso aparece.

Você não precisa banir um livro. Só precisa mantê-lo fora de algumas fontes-chave antes do próximo ciclo de treino. Você não precisa silenciar um escritor. Só precisa manter o site dele fora do índice. Você não precisa reescrever a história. Só precisa esperar a cauda longa afinar, e deixar a recursão fazer o resto.

Isso é censura no sentido matemático, uma redução no suporte da distribuição, sem nada que se pareça com um censor. Sem incêndio, sem lista de livros banidos, sem vilão público. Só uma decisão de indexação, propagada.

E porque tudo isso acontece rio acima do leitor, o leitor não consegue perceber. Você não nota os livros que não estão na prateleira quando nunca viu a prateleira.

quatro modelos leem por todo mundo

Você não precisa que a maior parte do conteúdo do mundo esteja ausente. Só precisa que esteja ausente de três ou quatro modelos.

As pessoas usam o que é bom e conveniente. O ranking do LMArena é dominado por um punhado (GPT, Claude, Gemini, Grok) e os próximos trinta são notas de rodapé para hobistas. Se você perguntar algo real a uma pessoa real este ano, a resposta quase certamente passou por um desses quatro modelos.

A concentração é o multiplicador. Se seu trabalho não está no corpus em que esses quatro foram treinados, ou fica abaixo do limiar de relevância deles, o leitor mediano de 2030 nunca vai encontrá-lo, mesmo que a página ainda exista, mesmo que o Common Crawl ainda tenha um snapshot em algum lugar. O funil é estreito de propósito. Modelos melhores custam mais para treinar e servir. A economia empurra para poucos vencedores. Os poucos vencedores escolhem o que sobrevive.

o que isso significa para o seu trabalho

Se você escreve na internet hoje, está competindo por uma vaga na visão de mundo de um número pequeno de modelos. A maior parte do que é publicado não consegue uma.

O post do Substack que você escreveu em março passado. O site do Notion sobre sua startup. O ensaio do LinkedIn que teve 200 curtidas. Seu trabalho provavelmente não vai sumir: a maior parte acaba sendo raspada eventualmente. O que acontece é mais difícil de combater: ele se dilui num mar de conteúdo redigido por IA em torno dos mesmos prompts. O modelo sabe que você escreveu algo. Só não te dá peso acima do ruído.

E se você não entrar no próximo ciclo de treino de jeito nenhum, ou entrar mas for rebaixado a ruído de fundo, o efeito prático é o mesmo de nunca ter publicado. O leitor que pergunta ao modelo nunca descobre que você escreveu aquilo.

Você não controla o índice. Você controla o que coloca nele, e com que frequência. Ou você está no índice, ou já está invisível.

um registro, por via das dúvidas

A probabilidade deste próprio post sobreviver à próxima década na visão de mundo de algum LLM não é zero. Mas também não é um.

O seu também não.

Este blog é uma pequena aposta contra o apagamento, um lugar para deixar o que eu penso e o que pessoas que admiro pensam, em URLs estáveis, espelhadas, alimentando o índice, para que alguma versão disso tenha uma chance de chegar a qualquer coisa que os leitores de 2035 estejam usando.

Eu não acho que a internet precise morrer. A biblioteca pode ser reconstruída, melhor desta vez, porque sabemos o que está em jogo. Isso é um desafio a resolver, não um destino a aceitar.

O resultado padrão é o apagamento. A exceção é o que você escolhe colocar no índice, e com que frequência. Escreva a coisa. Publique em algum lugar estável. Espelhe.

Footnotes

  1. Graphite, More Articles Are Now Created by AI Than Humans, out. 2025, n = 65.000 artigos em inglês do Common Crawl, jan. 2020 a maio de 2025, avaliados com o detector de IA da Surfer. O dado de 14% de visibilidade no Google Search é do mesmo estudo. 2

  2. Shumailov, I., Shumaylov, Z., Zhao, Y., Papernot, N., Anderson, R. & Gal, Y. AI models collapse when trained on recursively generated data. Nature 631, 755–759 (2024).

  3. O Gartner vem projetando há vários anos que dados sintéticos vão ofuscar dados reais no treinamento de IA até 2030. Marco anterior: Gartner (2021) projetou que 60% dos dados de IA/analytics seriam gerados sinteticamente até 2024.

  4. Estimativa acadêmica padrão (ver Reynolds & Wilson, Scribes and Scholars), embora contestada quanto ao método. De ~300 tragédias atenienses conhecidas pelo nome, 32 textos completos sobrevivem.

  5. Leonid Taycher, “Books of the world, stand up and be counted! All 129,864,880 of you,” blog do Google Books, agosto de 2010.

  6. O Google Books reportou mais de 40 milhões de itens escaneados no aniversário de 15 anos, em outubro de 2019. O HathiTrust reportou mais de 18 milhões de volumes em setembro de 2024.

  7. Blog do Internet Archive, “Let Readers Read,” 17 de junho de 2024, cita a cifra de ~500 mil para os livros removidos da CDL após a vitória das editoras no SDNY.

  8. Hachette Book Group, Inc. v. Internet Archive, No. 23-1260, 2º Circuito, 4 de setembro de 2024 (confirmando o SDNY).

about:blank ↗ open in new tab
site won't load? ↗ open in new tab
doom.exe, id Software, 1993

click inside the canvas to enable keyboard + sound · arrows / WASD to move · ctrl to fire

mario-bross.exe, Nintendo, 1985

click canvas to enable keys · arrows = D-pad · Ctrl/⌃ = A (jump) · Alt/⌥ = B (run) · 1 = Start · 2 = Select · Tab = remap
🔇 audio? open at archive.org once, click their speaker icon to unmute, reload here.

carmen.exe, Brøderbund / Sega, 1996

click "Click to Begin" then canvas · arrows = D-pad · Ctrl/⌃ = A · Alt/⌥ = B · Space = C · 1 = Start · Tab = remap
🔇 audio? open at archive.org once, click their speaker icon to unmute, reload here.

pokemon.exe, Game Freak, 1996

click canvas to enable keys · arrows = D-pad · Ctrl/⌃ = A · Alt/⌥ = B · 1 = Start · 2 = Select · Tab = remap
🔇 audio? open at archive.org once, click their speaker icon to unmute, reload here.

zork.exe, Infocom, 1980

click canvas to type. text adventure, try look, n s e w, open mailbox, take leaflet, read leaflet. quit with quit.

paint.exe, untitled.png
,
Trash
empty
Finder
~
help.txt, bash, ~

$ what is this?

lauta.blog is a personal site by Lautaro Schiaffino, a serial founder. It collects what he's learned from building three companies (Rodati, Sirena, Darwin AI) and from living, plus a few side rooms (books, food, board games, portfolio).

$ how do I navigate?

Three ways:

  1. Tabs at the top of the terminal window (~ · sirena · darwin · rodati · whoami · portfolio · books · boardgames · food) click any to switch sections.
  2. Keyboard shortcuts, press ? to see all of them. g+s jumps to Sirena, D toggles dark mode, etc.
  3. Shell, click the + at the end of the tab bar to open an interactive shell. Try tree, ls darwin, cat sirena/lesson-1.md, open whoami, subscribe you@example.com, help.

$ what about the menu bar?

$ traffic lights work

The three dots in the title bar do something: red closes the window (icon appears on the desktop, click to reopen), yellow minimizes (pill at bottom of desktop, click to restore), green maximizes.

$ contact

Reach me on x.com, or subscribe at /newsletter.

$ shortcuts

Press ? any time, or .

shortcuts.txt, bash, ~
navigation
g hhome (~/)
g wwhoami
g ssirena
g ddarwin
g rrodati
g ccocinasinde
g bbin
g ffood
g nnewsletter
g ttags
g uuses
view
Dtoggle dark mode
+bigger text
smaller text
0reset text size
edit
aselect all
ycopy page url
window
nnew shell tab
mminimize
zzoom (max)
xclose window
obring to front
help
?toggle this help
escclose