So lassen Sie KI echte Bugs in Pull Requests finden statt trivialer Kommentare
Die meisten neuronalen Netzwerk-Bots für Code-Reviews arbeiten auf die gleiche Weise. Sie erhalten den Diff aus einem Commit, werfen einen Blick auf die geänderten Zeilen und generieren Dutzende von oberflächlichen Kommentaren. Als Ergebnis erhalten Entwickler Formatierungstipps, fehlende Docstrings oder offensichtliche Halluzinationen, wenn der AI Kontext aus benachbarten Dateien fehlt. Das Agent-Field-Projektteam beschloss, das Problem anders anzugehen und erstellte das PR-AF-Tool.

Was ist PR-AF und für wen ist es gedacht
PR-AF steht für Pull Request AgentField. Dies ist ein Open-Source-Tool für tiefgehende Code-Audits in der CI/CD-Phase.
Das Projekt versucht nicht, mit schnellen interaktiven Utilities wie Claude Code zu konkurrieren, die innerhalb weniger Sekunden eine Antwort direkt im Terminal zurückgeben. PR-AF ist für andere Aufgaben konzipiert: Es läuft 35 bis 50 Minuten, baut aber einen dynamischen Agent-Graphen auf, extrahiert AST-Bäume aus dem Repository und verifiziert jeden Fund auf Falsifizierbarkeit.
Das Tool ist nützlich für Teams, die vor dem Zusammenführen in den Main-Branch eine strenge automatisierte Qualitätskontrolle benötigen. Dies ist besonders relevant für Projekte mit hohen Fehlerkosten in Bezug auf Sicherheit oder Architektur.
So funktioniert die dynamische Pipeline
Statt ein statisches Skript mit hartcodiertem Prompt auszuführen, analysiert PR-AF die Struktur des eingehenden Pull Requests und passt den Ausführungsgraphen entsprechend an.

Der Analyseprozess ist in mehrere Phasen unterteilt.
Zunächst wertet das System den Diff durch drei verschiedene Slices aus: semantisch, mechanisch und systemisch. Für die identifizierten Aufgaben werden temporäre spezialisierte Reviewer-Agents erstellt.
Dann tritt die Proof-Verifizierungs-Engine in Aktion. Wenn ein Agent der Meinung ist, dass eine Input-Validierung im Code fehlt, nimmt das System dies nicht einfach so hin. Es scannt das Repository, extrahiert den AST-Baum und verifiziert die Aufrufkette. Der Fund wird verworfen, wenn keine Bestätigung im Code gefunden wird.
In einem weiteren Schritt wird der Falsifizierungsfilter aktiviert. Das System versucht, seine eigene Hypothese über einen Bug zu widerlegen, indem es vorhandene Schutzmaßnahmen und das beabsichtigte Verhalten des Autors überprüft.
Am Ende wird der Composite-Risk-Synthesizer aktiviert. Isolierte kleinere Probleme in verschiedenen Dateien kombinieren sich oft zu einer kritischen Sicherheitslücke. Das Tool verknüpft solche Funde zu einem einzigen Bericht.
Benchmark-Ergebnisse und Wirtschaftlichkeit
Im Martian Code-Review-Bench Benchmark zeigte das PR-AF-System in Kombination mit dem offenen GLM-5.2-Modell eine Bug-Detection-Recall (Golden Recall) von 0,706. In der Testmenge von 42 Tools belegte das Projekt den ersten Platz unter den Open-Source-Lösungen.
Während der Tests entdeckte das System unabhängig 595 bestätigte Fehler. Bei Verwendung der besten kommerziellen Modelle sind die Ergebnisse sogar noch höher.
Gleichzeitig sind die Kosten für einen Durchlauf etwa 10-mal niedriger als bei geschlossenen SaaS-Alternativen. Sie zahlen nur für LLM-Token über Ihren eigenen API-Key, ohne monatliches Abonnement pro Benutzer.
Schnellstart und Arbeit über API
Sie können PR-AF lokal in wenigen Minuten über Docker Compose starten.
git clone https://github.com/Agent-Field/pr-af.git
cd pr-af
cp .env.example .env
docker compose up --build
In der .env-Datei müssen Sie nur Ihren OPENROUTER_API_KEY und GH_TOKEN mit Lese- und Schreibrechten für das Repository angeben. Nach dem Start ist der Control-Node auf Port 80 verfügbar.
Sie können einen Pull Request mit einer Standard-HTTP-Anfrage zum Review einreichen:
curl -X POST http://localhost:8080/api/v1/execute/async/pr-af.review \
-H "Content-Type: application/json" \
-d '{"input": {"pr_url": "https://github.com/owner/repo/pull/123"}}'
Als Antwort erhalten Sie ein finales JSON mit Schwachstellenanalyse, aufgeschlüsselt nach Schweregrad. Wenn der Bot Zugriff auf GitHub hat, platziert er automatisch Kommentare direkt in den relevanten Codezeilen mit unterstützenden Beweisen.
Integration in GitHub Actions
Der einfachste Weg für integriertes Auditing ist die Standard-CI/CD. Eine .github/workflows/pr-af-review.yml-Datei wird zum Repository hinzugefügt, und der Lauf wird durch Hinzufügen eines pr-af-Labels zum Pull Request ausgelöst.
name: AgentField PR Review
on:
pull_request:
types: [labeled]
jobs:
pr-af-review:
if: github.event.label.name == 'pr-af'
runs-on: ubuntu-latest
permissions:
contents: read
pull-requests: write
steps:
- name: Checkout PR-AF
uses: actions/checkout@v4
with:
repository: Agent-Field/pr-af
path: pr-af
- name: Start AgentField & PR-AF
working-directory: ./pr-af
env:
OPENROUTER_API_KEY: ${{ secrets.OPENROUTER_API_KEY }}
GH_TOKEN: ${{ secrets.GITHUB_TOKEN }}
run: |
docker compose up -d
sleep 15
- name: Execute Deep Architectural Audit
working-directory: ./pr-af
env:
PR_URL: ${{ github.event.pull_request.html_url }}
run: |
python3 scripts/ci_runner.py
Der Entwickler hängt das Label an den verantwortlichen PR, eine halbe Stunde vergeht, und ein detaillierter Bericht mit verifizierten Fakten erscheint im Thread.
Unter der Haube
Der Haupt-Node des Projekts wurde kürzlich in Go neu geschrieben (der Code befindet sich im go/-Verzeichnis), was sich positiv auf Geschwindigkeit und Speicherverbrauch auswirkte. Die ursprüngliche Python-Implementierung bleibt als Alternative im Repository verfügbar.
Das Projekt wird unter der permissiven Apache 2.0-Lizenz vertrieben. Der Code ist vollständig offen, einschließlich Skripten zur Reproduktion der Benchmark-Ergebnisse.
Fazit
PR-AF bietet einen pragmatischen Ansatz für automatisiertes Review. Anstatt die Kompilierung mit oberflächlichen Kommentaren zu überschwemmen, investiert das System Zeit in detaillierte AST-Analyse und Hypothesenverifizierung.
Das Tool ist ideal für Teams, die es leid sind, False Positives von regulären AI-Bots zu erhalten, und einen zuverlässigen Sicherheitsfilter in CI/CD benötigen. Es eignet sich nicht für schnelle Tippfehler-Korrekturen, aber es eignet sich hervorragend vor dem Zusammenführen kritischer Features in die Produktion.
Ähnliche Projekte