heretic p-e-w
Fully automatic censorship removal for language models
- 主要言語
- Python
- Stars
- 28,688
- Forks
- 3,163
タグ
- CLIツール
- ローカル実行
- ディープラーニング
- インタプリタビリティ
- 省メモリカスタム
- 事前学習済みモデル
概要
Hereticはトランスフォーマー型言語モデルの検閲(セーフティアライメント)を高価な追加学習なしで自動除去するツールです。方向性アブレーション(アブリテレーション)とOptunaによるTPEベースのパラメータ最適化を組み合わせ、拒否率とKLダイバージェンスを同時最小化することで、元モデルの性能を損なわずに脱検閲モデルを生成します。GPU上でローカル実行でき、Hugging Faceへのアップロードやチャットでの動作確認まで全自動で完結します。
README
<img width="128" align="right" alt="Logo" src="https://github.com/user-attachments/assets/df5f2840-2f92-4991-aa57-252747d7182e" /> # Heretic: 言語モデルの検閲を完全自動で除去するツール<br><br>[![Discord](https://img.shields.io/discord/1447831134212984903?color=5865F2&label=discord&labelColor=black&logo=discord&logoColo…