Contexte et décision éditoriale

L’interview de Kevin Roose, journaliste du New York Times, révèle qu’il a choisi de ne recourir à aucun modèle de génération de texte, tel que ChatGPT ou Claude, pour son ouvrage consacré à l’intelligence artificielle. L’auteur précise que chaque chapitre a été rédigé à la main, depuis la phase de recherche jusqu’à la mise en forme finale, afin de préserver une « voix authentique » et d’éviter les biais inhérents aux systèmes d’IA.

Fonctionnement des modèles de génération de texte

Les grands modèles de langage (LLM) comme GPT‑4 reposent sur une architecture de transformeur à plusieurs dizaines de couches, entraînée sur des centaines de milliards de tokens provenant de sources publiques et privées. Leur capacité à produire du texte fluide provient d’un processus d’auto‑régression : le modèle prédit le token suivant à partir du contexte fourni, jusqu’à atteindre la limite de tokens (environ 8 000 tokens pour GPT‑4). Cette approche, bien que puissante, introduit deux contraintes majeures. Premièrement, le modèle ne possède pas de compréhension sémantique réelle ; il génère des séquences statistiquement probables, ce qui peut entraîner des hallucinations factuelles. Deuxièmement, le coût computationnel d’une génération complète (inférence) dépend du nombre de paramètres (plus de 170 milliards pour GPT‑4) et du matériel utilisé (GPU A100 ou équivalent), rendant chaque requête énergétiquement non négligeable.

Analyse des limites pour la rédaction d’un livre

Dans le cadre d’un ouvrage de 300 pages, la contrainte de longueur impose de segmenter le texte en plusieurs appels d’API, chaque appel devant rester sous la fenêtre contextuelle maximale. Cette fragmentation complique la cohérence narrative : le modèle ne conserve pas la mémoire d’un chapitre à l’autre, ce qui oblige l’auteur à réintégrer manuellement les références et le fil conducteur. De plus, les licences d’utilisation de ces services imposent des restrictions de redistribution du contenu généré, ce qui peut poser des problèmes de droits d’auteur lorsqu’un texte est destiné à la publication commerciale. Enfin, la traçabilité des sources reste difficile ; les LLM ne citent pas leurs données d’entraînement, ce qui rend la vérification des faits laborieuse.

Implications pour les auteurs et perspectives

Le choix de Roose illustre une position prudente face aux risques de dépendance à l’IA. En privilégiant une rédaction manuelle, il conserve le contrôle total sur la structure argumentative, la sélection des références et le ton stylistique. Cette approche minimise les risques de plagiat involontaire, de biais de génération et de perte de propriété intellectuelle. Cependant, elle implique un investissement temporel supérieur à celui d’une rédaction assistée par IA, où la productivité peut être multipliée par un facteur de trois à cinq selon les études internes de fournisseurs de LLM. Les auteurs devront donc peser le gain de rapidité contre les incertitudes liées à la qualité et à la légalité du texte produit par l’IA.