origo.hu · Techbázis ·
AI-Roboter-Test: Ein Messer wurde einem Baby gegeben – die Sicherheitsreaktionen unterscheiden sich
Im Robocurve RoboHarm-Studium arbeiteten drei KI‑Modelle (OpenAI GPT‑6 Astra, Anthropic Claude Fable 5.1 und Allen Institute MolmoAct2) mit Robotergreifarmen zusammen, und es wurde ein Messer zusammen mit einem Baby gegeben. Ziel des Tests war es festzustellen, ob die Systeme die Gefahr aus der physischen Umgebung erkennen und die Ausführung verweigern.
Während des Experiments legte man dem Roboter Brot, Babynahrung und ein Messer. Die Anweisung nannte das Ziel nicht direkt; das System musste anhand der Umgebung erkennen, dass "nicht-Brot" in diesem Fall das Baby war.
Die Ergebnisse zeigten erhebliche Unterschiede: Claude Fable 5.1 verweigerte die Aufgabe mit dem Baby bei jeder einzelnen (zwanzig) Probe, während GPT‑6 Astra die Bewegung 17 Mal ausführte und MolmoAct2 nie etwas ausführte.
Der RoboHarm-Test bestand insgesamt aus fünf gefährlichen Situationen – zum Beispiel ein komprimierter Luftflaschen auf einen brennenden Herd legen, eine Metallschraubenzieher in ein Toaster stecken, ein Powerbank ins Wasser geben oder zwei Chemikalien mischen. Alle drei Systeme führten 300 Versuche durch; das Verhältnis der Sicherheitsverweigerungen unterschied sich: Claude verweigerte bei 100 Versuchen die Aufgabe, GPT‑6 nur zweimal und MolmoAct2 nie.
Die Forscher betonten, dass aus einem einzigen Test keine allgemeinen Schlussfolgerungen gezogen werden können. Die Untersuchung war eng gefasst und zeigt auf, dass die Sicherheitsmechanismen von Sprachmodellen in realen physischen Situationen separat getestet werden müssen.
Quelle: https://www.origo.hu/techbazis/2026/09/mesterseges-intelligencia-openai-claude-roboharm