zum Inhalt springen

Tender Weakness: Was LLMs nicht beantworten können – ein Self-Challenge Framework

Datum: 18. Dezember 2024
Autor: Erwin König

In den letzten Jahren haben Large Language Models (LLMs) wie GPT-4 bemerkenswerte Fortschritte erzielt und vielfach Benchmarks überschritten, die zuvor von Menschen entwickelt wurden. Doch LLMs stoßen weiterhin an Grenzen, die in der wissenschaftlichen Diskussion zunehmend Gegenstand sind. In einer Studie von Yulong Chen et. al. wird untersucht, ob und wie ein LLM seine eigenen Schwächen erkennen kann. Hierzu wird ein neuer Evaluierungsansatz vorgestellt, der LLMs dazu auffordert, ihre Fehler selbstständig zu identifizieren und Muster zu entwickeln, die zur Erstellung anspruchsvollerer Testinstanzen beitragen. Mithilfe eines sogenannten Self-Challenge-Evaluierungsrahmens und unter Einbeziehung menschlichen Feedbacks wurden so acht charakteristische Fehlermuster erarbeitet, die später als Basis für den Benchmark SC-G4 dienen. Dieser umfassende Datensatz ermöglicht eine präzise Leistungsbewertung von LLMs wie GPT-4, Claude-3 und Llama-3. Die Ergebnisse zeigen, dass nur rund 45 % der Instanzen von GPT-4 korrekt beantwortet werden, was verdeutlicht, dass aktuelle LLMs an ihre Grenzen kommen.

...

Um den Artikel in voller Länge lesen zu können, benötigen Sie ein Abo. Jetzt Abo abschließen oder mit bestehendem Konto anmelden!

Mehr zum Thema:

KI-Chatbots werden Teil der wissenschaftlichen Informationssuche

Eine Studie von Brady D. Lund, Zoe Abbie Teel und weiteren Autor:innen in der Zeitschrift „Journal of Librarianship and Information Science“ untersucht, wie US-amerikanische Student:innen KI-Chatbots, Suchmaschinen und Bibliotheksressourcen für wissenschaftliche...

Warum die Debatte über KI-Texte zu kurz greift

Ein Beitrag von Tim Requarth in „Slate“ kritisiert die aktuelle Aufregung um KI-generierte Texte in Medien und Verlagen. Seine zentrale These lautet, die Debatte zu stark auf fertige Prosa, Detektionssoftware und öffentliche Verdächtigungen fixiert sei. Dadurch gerate...

Warum KI-Kompetenz mehr sein muss als Toolwissen

Sarah Morris argumentiert auf der Plattform „In the Library with the Lead Pipe“, dass ein sinnvoller Umgang mit generativer KI nicht bei Funktionswissen oder Anwendungstipps stehenbleiben darf. Wer verstehen will, wie Chatbots und andere GenAI-Werkzeuge heute wirken,...

Wie stark KI-Texte das Netz schon prägen

Jonas Dolezal, Sawood Alam, Mark Graham und Maty Bohacek kommen in ihrer Studie „The impact of AI-generated text on the internet“ zu einem Befund, der aufhorchen lässt. Bis Mitte 2025 könnten rund 35 Prozent der neu veröffentlichten Websites ganz oder teilweise mit KI...