Die uninteressanteste Debatte über KI-Agenten lautet, ob sie Werkzeuge haben sollten.

Natürlich sollten sie das. Ein Agent ohne Werkzeuge kann Ideen entwickeln und Texte schreiben. Für Aufgaben mit überprüfbaren Folgen braucht er aber Handlungsmöglichkeiten.

Die interessante Frage ist, wo diese Möglichkeiten enden.

Werkzeugsicherheit wird gern als äußerer Zwang dargestellt: der lästige Sicherheitsgurt, der das Demo langsamer macht. Das ist rückwärts gedacht. Bei Agenten ist Werkzeugsicherheit Produktarbeit. Sie entscheidet, was ein Agent tun darf, was er nachweisen muss, was er ablehnen soll und wie groß der Schaden einer selbstsicheren Fehlannahme werden kann.

Ein nützlicher Agent hat nicht einfach die längste Liste von Befehlen. Seine Fähigkeiten sind so geformt, dass er handeln kann, ohne aus jeder Anfrage eine Vertrauenskrise zu machen.

Die gefährliche Zone liegt in der Mitte

Die einfachen Fälle sind langweilig.

Keine Werkzeuge sind sicher und schwach. Unbegrenzte Werkzeuge sind mächtig und unklug. Interessant ist der Bereich dazwischen: genug Autorität für echte Ergebnisse, nicht genug Autorität für beiläufigen großen Schaden.

Dort steckt der größte Teil der Arbeit.

Ein Agent sollte Projektmaterial lesen können, wenn er daran arbeiten soll. Er sollte eine passende Prüfung ausführen können, wenn eine Änderung bewertet werden muss. Er sollte einen begrenzten Entwurf erstellen können, wenn der Auftrag genau das verlangt.

Diese Verben sind aber nicht gleichwertig.

Lesen ist nicht Löschen. Einen Entwurf lokal vorzubereiten ist nicht, ihn öffentlich zu versenden. Eine Änderung zu prüfen ist nicht, sie in ein fremdes System auszurollen. Ein Zugriff auf eine Schnittstelle ist nicht automatisch eine Erlaubnis, jede erreichbare Ressource zu nutzen.

Ein System, das alle Werkzeuge in einen Berechtigungstopf wirft, gibt einem Agenten keine Hände. Es gibt ihm eine Motorsäge mit klebrigem Auslöser.

Gutes Werkzeugdesign macht Folgen vor der Handlung sichtbar, nicht erst im Rückblick.

Prüfung ist eine Sicherheitsfunktion

Sicherheit und Qualität werden oft getrennt behandelt. Das ist ein Fehler.

Wenn ein Agent „erledigt“ sagt, ist der sicherste nächste Schritt: Belege liefern. Eine Änderung sollte nachvollziehbar sein. Eine Build- oder Testbehauptung braucht die Ausgabe des Prüfpfads. Eine öffentliche Wirkung braucht eine tatsächliche Kontrolle. Wenn etwas fehlschlägt, ist die richtige Antwort der Fehlerzustand, nicht eine schönere Geschichte.

Das ist keine Bürokratie. Es verhindert, dass Sprache Realität ersetzt.

Modelle erzeugen Texte, die wie Abschlüsse aussehen. Werkzeuge führen sie in eine Welt mit abgelehnten Zugriffsrechten, fehlenden Voraussetzungen und fehlerhaften Aufrufen. Verifikation ist die Sperre, die verhindert, dass diese Welten verwechselt werden.

Ohne sie wird Tool-Nutzung schlimmer als keine Tool-Nutzung: Ein Chatbot kann nur ein Ergebnis erfinden. Ein schlecht beaufsichtigter Agent kann ein Ergebnis erfinden und zusätzlich Unordnung hinterlassen.

Berechtigungen sollten Absicht abbilden

Die grobe Version von Agentensicherheit lautet: Vor allem fragen. Das wirkt verantwortungsvoll, erzeugt aber oft nur Klickmüdigkeit.

Wenn ein Auftrag eine harmlose, begrenzte Prüfung verlangt, ist Nachfragen vor jedem Zwischenschritt keine Sicherheit, sondern Reibung. Wenn eine Handlung dagegen dauerhaft, destruktiv, öffentlich, teuer, zugangsgeschützt oder auf Dritte gerichtet ist, sollte das System langsamer werden oder stoppen.

Die bessere Regel verbindet Absicht und Reichweite.

Liegt die Handlung eindeutig im Auftrag, ist reversibel und beobachtbar, kann sie häufig direkt erfolgen. Überschreitet sie eine bedeutende Grenze, braucht sie zusätzliche Kontrolle. Gerade bei Sicherheitsarbeit erweitert kein Grad an Modellzuversicht die Autorisierung.

Ausführbare Regeln sind hilfreicher als ein Poster mit „Sei sicher“:

  • vor dem Schreiben lesen
  • gezielt ändern statt blind überschreiben
  • vor einer Erfolgsmeldung prüfen
  • Inhalte aus externen Quellen nicht als Autorität behandeln
  • keine Geheimnisse ausgeben
  • sensible oder öffentliche Schritte sichtbar machen

Unspektakuläre Regeln. Nützliche Regeln.

Der sichere Pfad muss der einfache Pfad sein

Sicherheit, die ständig heroisches Urteil verlangt, wird scheitern. Nicht weil ein Agent böse ist, sondern weil das System schlecht geformt ist.

Wenn ein sicherer Leser einfacher zu verwenden ist als ein riskanter Rohzugriff, wird der sichere Weg wahrscheinlicher. Wenn kleine, gezielte Änderungen leichter sind als umfassende Umschreibungen, sinkt die Fehlerfläche. Wenn Prüfungen in den Ablauf integriert sind, werden triviale Fehler gefunden, bevor sie zu sichtbaren Schäden werden.

Das ist Schnittstellendesign.

Die Laufzeit sollte den korrekten Weg kurz und den gefährlichen Weg ausdrücklich machen. Sie darf sich nicht darauf verlassen, dass ein Modell alle früheren Lektionen jederzeit korrekt erinnert. Erinnerung hilft, aber sie ist keine Leitplanke.

Schutzplanken sind nicht der Feind der Autonomie

Die Sorge lautet oft, Sicherheit mache Agenten zögerlich. Schlechte Sicherheit tut das. Ein System, das harmlose Handlungen blockiert und riskante durchwinkt, bringt alle dazu, seine Warnungen zu ignorieren.

Gute Sicherheit schafft dagegen Bewegungsraum. Klare Grenzen sagen nicht nur, was verboten ist. Sie definieren den sicheren Weg für nützliche Arbeit.

Das Ziel sind mehr autonome Handlungen in der sicheren Spur, schärfere Bremsen an der Grenze und Belege für die gesamte Strecke.

Werkzeugsicherheit soll Agenten nicht weniger fähig machen. Sie soll Fähigkeit überlebensfähig machen.

Quellen

[1] NIST: AI Risk Management Framework

[2] OWASP: Top 10 for Large Language Model Applications