Resumo
A empresa ISBNdb, que possui uma vasta base de dados de livros, está fornecendo conteúdo para o treinamento de modelos de inteligência artificial (IA).
Esses modelos requerem dados de alta qualidade, preferencialmente de livros impressos lançados antes de 2022, considerados “mais limpos”, ou seja, sem conteúdo raso produzido por inteligências artificiais.
A aquisição em massa desses livros levanta preocupações, pois alguns podem ser destruídos após a leitura pelas máquinas. Obras raras estariam sob risco, e não há transparência dessas transações.
Modelos de IA atuais vêm recebendo uma fonte curiosa de informações: os livros impressos. Esse mercado tem sido alimentado pelo ISBNdb, site que diz ter a maior base de livros do mundo. A plataforma funciona como um reservatório digital das obras, com captação em pequenos e grandes fornecedores. Apesar de ser uma fonte importante para treinar IAs, há um receio quanto ao destino dessas unidades após a leitura das máquinas: muitos podem estar sendo “devorados”, ou pior, destruídos.
Segundo a ISBNdb, essa é a melhor forma de treinar os LLMs, uma vez que são materiais “limpos”, ou seja, sem o mal-falado AI Slop, conteúdo raso produzido com interferência de inteligências artificiais generativas. Ao utilizar dados mais recentes, a qualidade das informações levantadas pode cair, e a busca por livros impressos é uma forma de resolver o problema.
