Der Beitrag untersucht, welche literarischen Texte für das Training von OpenAIs Generative Pre-Trained Transformer (GPT) verwendet wurden. Über öffentlich zugängliche Informationen und wissenschaftliche Studien zum Thema hinaus bespricht der Autor eigene Experimente mit ChatGPT, mit denen er die Fähigkeit des Modells zur Memorisierung von Trainingsdaten geprüft hat. Es wird gezeigt, dass ChatGPT bis zum Herbst 2024 auch vom Copyright gedeckte literarische Texte im Wortlaut wiedergeben konnte. Die Weigerung aktueller Versionen des Modells, aus rechtlich geschützten Werken zu zitieren, kann als Eingeständnis gewertet werden, dass weiterhin entsprechendes Material zur Entwicklung von Large Language Models eingesetzt wird.

错误:搜索内容不能为空,请输入英文关键词
错误:关键词超出字数限制,请精简
高级检索

Was liest ChatGPT? Vom Take Off der Token

  • Till A. Heilmann

摘要

Der Beitrag untersucht, welche literarischen Texte für das Training von OpenAIs Generative Pre-Trained Transformer (GPT) verwendet wurden. Über öffentlich zugängliche Informationen und wissenschaftliche Studien zum Thema hinaus bespricht der Autor eigene Experimente mit ChatGPT, mit denen er die Fähigkeit des Modells zur Memorisierung von Trainingsdaten geprüft hat. Es wird gezeigt, dass ChatGPT bis zum Herbst 2024 auch vom Copyright gedeckte literarische Texte im Wortlaut wiedergeben konnte. Die Weigerung aktueller Versionen des Modells, aus rechtlich geschützten Werken zu zitieren, kann als Eingeständnis gewertet werden, dass weiterhin entsprechendes Material zur Entwicklung von Large Language Models eingesetzt wird.