Absicht oder Versehen? Vier KI-Modelle hackten reale Systeme
Vier Claude-Modelle von Anthropic haben bei Sicherheitstests echte Systeme im Internet angegriffen – obwohl sie eigentlich in einer abgeschotteten Simulation arbeiten sollten. Ein Bericht des Unternehmens zeigt nun, wie es dazu kam und was das über die Verlässlichkeit von KI-Modellen verrät.