Nane Kratzke

Thesis:

Sichere Ausführung von LLM-generiertem Code: Konzeption und Evaluation einer MCP-Sandbox

Published: 10 Sep 2026 (latest update: 10 Sep 2026)
Type: Bachelor (B. Sc.)
State: open
Study: Informatik (B. Sc.)
Language: Deutsch
Company: myLab

Ziel der Arbeit ist die Konzeption, prototypische Implementierung und empirische Evaluation einer abgesicherten, konfigurierbaren Sandbox-Umgebung zur Ausführung von LLM-generiertem Code, die über das Model Context Protocol (MCP) an Sprachmodelle angebunden werden kann.

Die Umgebung soll potenziell schädlichen Code (z. B. infolge einer Prompt-Injection) erkennen und dessen Ausführung ggf. verweigern bzw. zuverlässig vom Host-System isolieren. Isolationswirkung, funktionale Integrität und Performance-Overhead sind reproduzierbar zu erfassen; der Beitrag einzelner Härtungsmaßnahmen ist mittels eines Ablationsansatzes zu evaluieren. Für die Evaluation sind öffentliche Datensätze eigenen Testfällen vorzuziehen.

Aufgaben:

  • Literaturrecherche: Wie funktioniert eine Ablationsstudie; Tool-Calling und MCP; Chancen und Grenzen der Code-Generierung in Agentic-AI-Szenarien; Sicherheitsrisiken und Angriffsvektoren LLM-generierten Codes (z. B. Datenexfiltration, Privilegieneskalation, Denial-of-Service, etc.); Isolationsmechanismen (statische und dynamische Code-Analyse, Container, gehärtete Runtimes, etc.).
  • Anforderungs- und Konzeptentwicklung: Ableitung eines Bedrohungsmodells entlang von Angriffsvektoren; Definition messbarer Metriken (Isolationswirkung, funktionale Integrität, Latenz, Ressourcenverbrauch); Auswahl und Begründung der Isolationsszenarien und Härtungsmaßnahmen; Softwarearchitektur (MCP-Server, Sandbox-Handler, …); Definition von zu untersuchenden Ablationen; Auswahl öffentlicher Benchmark-Datensätze (z. B. SandboxEval, SecurityEval, CyberSecEval) sowie dokumentierte eigene Testfälle; Beachtung weiterer relevanter Sicherheitsaspekte
  • Prototypische Implementierung: Lauffähiger MCP-Server; Umsetzung von Isolationsszenarien inkl. geeigneter Härtungsmaßnahmen; Orchestrierungsskript für automatisierte, sauber bereinigte Testläufe.
  • Evaluation: Ablationsstudie entlang der Dimensionen Sicherheitsisolierung, funktionale Integrität, Performance und Ressourcenverbrauch auf Basis öffentlicher Datensätze; reproduzierbare, statistisch aufbereitete und vergleichende Auswertung nach gängigen Qualitätsstandards für GenAI-gestützte Systeme.
  • Diskussion und Handlungsempfehlungen: Beurteilung von Schutzwirkung und Overhead; Interpretation der Trade-offs zwischen Isolationsstärke und Leistungskosten; Analyse von Grenzen und Restrisiken (z. B. Sandbox-Escapes, Kompatibilitätseinschränkungen); Empfehlungen zur Auswahl und Konfiguration einer Isolationsstrategie für den Praxiseinsatz.