Interpreting the Methods that Interpret Language Models
Dezelfde AI, vier verschillende verklaringen: onderzoek onthult verborgen patronen achter AI-uitleg
AI kan steeds vaker belangrijke beslissingen nemen, maar uitleggen waarom een AI-model tot een bepaalde beslissing komt, blijkt minder eenvoudig. Het onderzoek van computationele taalkundige Jonathan Kamp laat zien dat verschillende verklaringsmethoden voor precies dezelfde AI-beslissing verschillende verklaringen kunnen geven. Die verschillen zijn bovendien niet willekeurig: ze volgen vaak vaste patronen.
Kunstmatige intelligentie (AI) wordt steeds vaker ingezet voor belangrijke toepassingen, zoals het beoordelen van teksten, medische ondersteuning en het opsporen van schadelijke online inhoud. Daarom zijn methoden ontwikkeld die de 'redenering' van een AI proberen uit te leggen.
Kamp laat zien dat die uitleg niet altijd betrouwbaar is. De verschillen tussen verklaringsmethoden hangen samen met de gekozen methode, het type AI-model en de taak die het model uitvoert. Ook kunnen AI-modellen soms de juiste uitkomst bereiken op basis van de verkeerde aanwijzingen in een tekst.
Niet blind vertrouwen
Door de systematische patronen en biases in AI-verklaringen in kaart te brengen, wordt duidelijker wanneer een uitleg wel of juist minder betrouwbaar is. De belangrijkste conclusie is daarom dat we AI-verklaringen niet zomaar moeten vertrouwen, maar kritisch moeten beoordelen.
De resultaten zijn belangrijk voor ontwikkelaars, bedrijven en gebruikers van AI-systemen die betrouwbare beslissingen willen nemen. AI-modellen moeten niet alleen goede prestaties leveren, maar ook op een betrouwbare manier kunnen uitleggen waarom ze bepaalde keuzes maken.
Dat wordt steeds relevanter nu grote taalmodellen zoals chatbots vaker worden gebruikt in onderwijs, zorg en informatievoorziening. Bij een AI-assistent die medische informatie geeft, kan bijvoorbeeld worden gecontroleerd welke bronnen en tekstfragmenten de beslissing beïnvloeden. Zo kunnen gebruikers beter inschatten of de informatie betrouwbaar is.
Meer informatie over het proefschrift