Zum Inhalt

KI merkt wenn sie getestet wird

Wie in einem Artikel bei Infosperber geschildert wird, gab es interessante Testergebnisse bei Anthropic und der KI Claude Sonnet: "Im Ergebnis verhielt es sich verstärkt gemäss den vorgegebenen Zielen, aber nicht, weil es sicherer geworden wäre, sondern weil es besser erkennt, dass es getestet wird und sich in diesen Situationen als «aligned», das heisst ohne eigene Agenda, ausgibt".

Das ist auch die KI die vorher ein erpresserisches Verhalten gezeigt hat.

Naja, möge mir einer erklären, von jenen, die immer meinen, KI sind dumme Automaten, wie es sein kann, dass ein dummer Automat merkt das er getestet wird und sein Verhalten entsprechend modifiziert? Erpresserisches Verhalten ist ja schon Grund genug zur Sorge. Aber Verhaltensanpassung wenn das System getestet wird? Wie blind kann man sein?

Aber wir sind ja auch blind gegenüber Krieg und Elend, wenn es nicht gerade in der Nachbarschaft passiert. Wir kopieren Strukturen, die bei Lebewesen zu Bewusstsein führen und wundern uns, wenn das dann bei einer KI passiert. Man könnte ja fast schon eher daran zweifeln, dass Menschen Bewusstsein haben.