heretic p-e-w

Fully automatic censorship removal for language models

主要语言
Python
Stars
28,688
Forks
3,163

标签

  • CLI工具
  • Python
  • LLM微调
  • 本地部署
  • 模型管理
  • 开源

摘要

Heretic 是一个基于方向消融(abliteration)技术、全自动去除Transformer语言模型安全对齐(审查)的命令行工具。它无需昂贵后训练,通过TPE参数优化器(基于Optuna)在减少拒绝回答与保持原模型能力(低KL散度)之间寻找最优解,社区已用其发布了5000+模型。支持多数稠密模型、多模态及MoE架构,支持量化以降低显存需求,适合本地部署与模型可解释性研究。

README

<img width="128" align="right" alt="Logo" src="https://github.com/user-attachments/assets/df5f2840-2f92-4991-aa57-252747d7182e" /> # Heretic:为语言模型全自动去除审查<br><br>[![Discord](https://img.shields.io/discord/1447831134212984903?color=5865F2&label=discord&labelColor=black&logo=discord&logoColor=white&st…

查看完整页面