heretic p-e-w
Fully automatic censorship removal for language models
- 主要语言
- Python
- Stars
- 28,688
- Forks
- 3,163
标签
- CLI工具
- Python
- LLM微调
- 本地部署
- 模型管理
- 开源
摘要
Heretic 是一个基于方向消融(abliteration)技术、全自动去除Transformer语言模型安全对齐(审查)的命令行工具。它无需昂贵后训练,通过TPE参数优化器(基于Optuna)在减少拒绝回答与保持原模型能力(低KL散度)之间寻找最优解,社区已用其发布了5000+模型。支持多数稠密模型、多模态及MoE架构,支持量化以降低显存需求,适合本地部署与模型可解释性研究。
README
<img width="128" align="right" alt="Logo" src="https://github.com/user-attachments/assets/df5f2840-2f92-4991-aa57-252747d7182e" /> # Heretic:为语言模型全自动去除审查<br><br>[![Discord](https://img.shields.io/discord/1447831134212984903?color=5865F2&label=discord&labelColor=black&logo=discord&logoColor=white&st…