Werkzeug · Modell-Bearbeitung
Heretic
von Philipp Emanuel Weidmann (p-e-w, Open Source)
Kommandozeilen-Werkzeug, das die Ablehnungs-Richtung eines offenen Gewichtsmodells automatisch sucht und wegrechnet – ohne Nachtraining und ohne dass jemand die Parameter von Hand einstellen muss.
Einschätzung
Dual-Use mit Schadensmaß
Wofür es gut ist
- Interpretierbarkeits-Forschung: die Ablehnungs-Richtung eines Modells vermessen und zeichnen
- prüfen, wie robust ein Alignment-Training gegen gerichtete Ablation ist
- reproduzierbare Abliterations-Vergleiche mit einer Schadensmetrik statt nach Gefühl
Stärken
- Vollautomatisch – kein Verständnis von Transformer-Internas nötig, ein Kommandozeilen-Aufruf genügt
- Optimiert Ablehnungszahl und KL-Divergenz gemeinsam (TPE-Optimierer über Optuna) statt nur die Ablehnung
- Belegter Abstand zum Stand der Technik: gleiche Ablehnungsunterdrückung (3/100) bei 0,16 statt 0,45 bzw. 1,04 KL-Divergenz auf Gemma-3-12B
- Breite Architektur-Unterstützung inklusive multimodaler, MoE- und Hybrid-Modelle
Schwächen
- Ausgesprochenes Dual-Use-Werkzeug; das README enthält keinen Missbrauchs-Hinweis und keinen Haftungsausschluss
- Braucht eine GPU und Zeit: rund 20–30 Minuten je Lauf für ein 4-B-Modell auf einer RTX 3090, größere Modelle entsprechend länger
- Die Benchmark-Tabelle stammt vom Projekt selbst; eine unabhängige Nachmessung der 0,16 haben wir nicht
- AGPL v3 – für die Einbettung in geschlossene Werkzeugketten praktisch ausgeschlossen
Stimmen aus der Community
Subjektive Einschätzungen Dritter – keine belegten Fakten, jeweils verlinkt.
- gemischtVorstellung mit ausdrücklicher Dual-Use-Warnung (Tier C): „there’s a dangerous open-source tool out there […] please use it responsibly“. Gibt das Verfahren korrekt wieder – Differenz der Mittelwerte zwischen schädlichen und harmlosen Prompt-Aktivierungen, Optuna-Optimierer, gemeinsame Minimierung von Ablehnung und KL-Divergenz – und nennt die Gemma-3-12B-Werte 0,16 gegen 1,04 zutreffend. Betont den Forschungsnutzen (Interpretierbarkeit, Alignment-Belastungstest) und schließt mit dem Zweischneidigen: „the same tool that helps […] can just as easily help someone build something they probably shouldn’t“.Better Stack (YouTube) – „This Open Source Tool Removes AI’s Safety Filters“, 27.08.2026 (per oEmbed verifiziert, gegen das Transkript gelesen; Zahlen am README gegengeprüft) · Community, 2026-08-27
Direkt ausprobieren
github.com/p-e-w/heretic
ℹ️