zum Inhalt springen

Transparente Daten für vertrauenswürdiges maschinelles Lernen: Wie wissenschaftliche Dokumentation den ML-Standard verbessern kann

Datum: 15. März 2025
Autor: Erwin König

Transparente und verantwortungsbewusste Nutzung von Machine-Learning-(ML)-Systemen hängt maßgeblich von der Qualität und Transparenz der zugrundeliegenden Trainingsdaten ab. Während in vielen wissenschaftlichen Disziplinen die Publikation von Data Papers (Veröffentlichung von dokumentierten Datensätzen in einem Data Journal) längst etabliert ist, stellt sich die Frage, ob diese Standards den Anforderungen der ML-Community und regulatorischen Vorgaben gerecht werden. Eine aktuelle Studie analysiert über 4000 wissenschaftliche Data Papers und vergleicht sie mit ML-spezifischen Dataset-Beschreibungen. Die Ergebnisse zeigen sowohl Fortschritte als auch Lücken in der Dokumentation und bieten klare Empfehlungen, wie Datenersteller und Verlage die Nachvollziehbarkeit und Fairness von ML-Modellen künftig verbessern können. Welche Maßnahmen nötig sind und wie sich die wissenschaftliche Praxis auf die technologische Entwicklung auswirkt, erfahren Sie in unserem Artikel. 

...

Um den Artikel in voller Länge lesen zu können, benötigen Sie ein Abo. Jetzt Abo abschließen oder mit bestehendem Konto anmelden!

Mehr zum Thema:

KI-Chatbots werden Teil der wissenschaftlichen Informationssuche

Eine Studie von Brady D. Lund, Zoe Abbie Teel und weiteren Autor:innen in der Zeitschrift „Journal of Librarianship and Information Science“ untersucht, wie US-amerikanische Student:innen KI-Chatbots, Suchmaschinen und Bibliotheksressourcen für wissenschaftliche...

Warum die Debatte über KI-Texte zu kurz greift

Ein Beitrag von Tim Requarth in „Slate“ kritisiert die aktuelle Aufregung um KI-generierte Texte in Medien und Verlagen. Seine zentrale These lautet, die Debatte zu stark auf fertige Prosa, Detektionssoftware und öffentliche Verdächtigungen fixiert sei. Dadurch gerate...

Warum KI-Kompetenz mehr sein muss als Toolwissen

Sarah Morris argumentiert auf der Plattform „In the Library with the Lead Pipe“, dass ein sinnvoller Umgang mit generativer KI nicht bei Funktionswissen oder Anwendungstipps stehenbleiben darf. Wer verstehen will, wie Chatbots und andere GenAI-Werkzeuge heute wirken,...

Wie stark KI-Texte das Netz schon prägen

Jonas Dolezal, Sawood Alam, Mark Graham und Maty Bohacek kommen in ihrer Studie „The impact of AI-generated text on the internet“ zu einem Befund, der aufhorchen lässt. Bis Mitte 2025 könnten rund 35 Prozent der neu veröffentlichten Websites ganz oder teilweise mit KI...

Wie Forschende mit KI-gestützten Recherchetools arbeiten

Eine Studie von Dany Haddad und Kolleg:innen analysiert in „Understanding Usage and Engagement in AI-Powered Scientific Research Tools: The Asta Interaction Dataset“ auf der Preprint-Plattform „arXiv“, wie Forschende tatsächlich mit KI-gestützten Rechercheplattformen...