Wenn die Eingabe zum Angriff wird

AI-Pentest für LLMs, Agenten und KI-integrierte Anwendungen. Wir testen entlang der OWASP LLM Top 10 und darüber hinaus: von Prompt Injection über Tool Abuse bis zu den klassischen Schwachstellen im KI-Backend.

  • OWASP LLM Top 10
  • MITRE ATLAS als Threat-Modell
  • Manuelles Testing, kein reines Scanning

Der Weg einer Eingabe durch euer KI-System

Stufe Was dort passiert Wo ein Angreifer ansetzt
1

Eingabe

Was der Nutzer tippt, und was das System nebenbei liest: Mails, Dokumente, Webseiten.

Prompt Injection

Direkt über die Eingabe oder indirekt über externe Daten.

2

System-Prompt und Guardrails

Die Anweisungen, die das Verhalten festlegen sollen, samt Toolbeschreibungen.

Jailbreak, Prompt Leakage

Guardrails umgehen, Rolle überschreiben, den System-Prompt herausziehen.

3

Kontext aus RAG

Vektordatenbank und Dokumentenspeicher liefern den Kontext für die Antwort.

Embedding Poisoning

Unautorisiertes Retrieval, manipulierte Vektorbasis, Membership Inference.

4

Tool-Aufruf

Der Agent liest Postfächer, führt Code aus, fragt Datenbanken ab.

Tool Abuse, Excessive Agency

Nicht autorisierte Tool-Calls, Rechteausweitung, SSRF und Path Traversal.

5

Ausgabe an nachgelagerte Systeme

Die Antwort landet im Browser, in einer Datenbankabfrage, in einem Skript.

Insecure Output Handling

Ungefilterte Ausgaben werden zu XSS, SQL Injection oder Code Execution.

Was im Bericht steht

  • Findings, die wir tatsächlich ausgenutzt haben, mit Reproduktionsschritten

  • Jedes Finding auf die OWASP LLM Top 10 gemappt

  • Management-Summary und nach Business Impact priorisierte Empfehlungen

  • Re-Test nach der Behebung auf Wunsch

Drei Einstiegspunkte

LLM Application Pentest

OWASP LLM Top 10 · Chat und API

Prompt Injection, Output Handling, System Prompt Leakage, unsichere Plugins. Für interne Assistenten und öffentliche KI-Produkte.

Agentic AI Assessment

Tool Abuse · RAG · Multi-Agent

Für autonome Agenten mit Tool-Zugriff: Tool Authorization, Privilege Escalation, indirekte Prompt Injection, Multi-Agent Trust Boundaries.

ML Model Security Assessment

Adversarial ML · Model Extraction

Das Modell selbst: Adversarial Robustness, Model Extraction, Evasion Attacks auf Fraud Detection und Bilderkennung.

Welcher Schwerpunkt passt, hängt von System und Reifegrad ab. Oft kombinieren wir alle drei.

OWASP LLM Top 10: alle zehn Kategorien im Test

  1. Prompt Injection

    Konstruierte Eingaben steuern die Ausgabe, direkt oder indirekt.

  2. Sensitive Information Disclosure

    Trainingsdaten, Konfiguration oder Daten fremder Sitzungen.

  3. Supply Chain Vulnerabilities

    Kompromittierte Basismodelle, Plugins oder Datenpipelines.

  4. Data und Model Poisoning

    Manipulierte Trainingsdaten erzeugen gezielte Backdoors.

  5. Insecure Output Handling

    Ausgaben gehen ungefiltert weiter, als Code oder als Query.

  6. Excessive Agency

    Der Agent darf mehr, als seine Aufgabe braucht.

  7. System Prompt Leakage

    Interne Anweisungen und Toolbeschreibungen lassen sich ziehen.

  8. Vector und Embedding Weaknesses

    Poisoning und unautorisiertes Retrieval in der Vektorbasis.

  9. Misinformation

    Plausibel klingende Falschaussagen mit realer Wirkung.

  10. Unbounded Consumption

    Aufwändige Anfragen erzwingen DoS und hohe API-Kosten.

Wie ein AI-Pentest abläuft

  1. Scoping und Systemverständnis

    Welche Modelle, Datenquellen und Tools sind im Scope, welche Berechtigungen hat der Agent?

  2. Threat Modeling

    Angriffspfade aus der Architektur ableiten, nach OWASP LLM Top 10, MITRE ATLAS und eigenen Testfällen.

  3. Aktives Testing

    Prompt Injections, Tool Abuse, RAG-Angriffe, API-Tests. Jeder Versuch wird protokolliert.

  4. Exploitvalidierung

    Jedes Finding wird auf tatsächliche Ausnutzbarkeit und Auswirkung geprüft.

  5. Bericht und Remediation

    Bericht mit OWASP-LLM-Mapping, Reproduktionsschritten und Management-Summary.

Häufige Fragen

Wir nutzen nur Copilot oder ChatGPT Enterprise. Reicht das nicht?

Das Risiko liegt bei euch in der Konfiguration, nicht im Modell des Anbieters. Wie ist der System-Prompt aufgebaut, welche Daten darf der Assistent abrufen, greifen eure Berechtigungen auch dann, wenn ein Nutzer per Prompt Injection nachhilft? Das ist eure Implementierung, und die testen wir.

Braucht ihr Zugriff auf das Modell?

Für ein Black-Box-Assessment reicht der Zugang, den auch ein normaler Nutzer hat. Grey Box und White Box, also Einblick in System-Prompts, Toolkonfiguration und Architektur, führen zu tieferen Findings. Welcher Ansatz passt, klären wir im Scoping.

Was ist an indirekter Prompt Injection so gefährlich?

Der Angriff kommt nicht vom Nutzer, sondern aus den Daten, die das Modell liest: eine E-Mail, ein Dokument, eine Webseite. Liest ein Agent eine präparierte Mail und löst daraufhin eine Aktion aus, war der Angreifer nie mit dem System in Kontakt.

Was unterscheidet das von einem klassischen Pentest?

Der klassische Test prüft Infrastruktur, Netz und Applikation. Beim AI-Pentest kommen die modellspezifischen Vektoren dazu: Prompt Injection, Jailbreaking, Tool Abuse, RAG Poisoning, adversarielle Eingaben. Weil KI-Systeme auf normaler Infrastruktur laufen, machen wir beides.

Euer KI-Stack auf dem Prüfstand

Im kostenlosen Erstgespräch klären wir Architektur, Scope und Testmodell. Danach bekommt ihr ein schriftliches Angebot.