heretic p-e-w

Fully automatic censorship removal for language models

主要言語
Python
Stars
28,688
Forks
3,163

タグ

  • CLIツール
  • ローカル実行
  • ディープラーニング
  • インタプリタビリティ
  • 省メモリカスタム
  • 事前学習済みモデル

概要

Hereticはトランスフォーマー型言語モデルの検閲(セーフティアライメント)を高価な追加学習なしで自動除去するツールです。方向性アブレーション(アブリテレーション)とOptunaによるTPEベースのパラメータ最適化を組み合わせ、拒否率とKLダイバージェンスを同時最小化することで、元モデルの性能を損なわずに脱検閲モデルを生成します。GPU上でローカル実行でき、Hugging Faceへのアップロードやチャットでの動作確認まで全自動で完結します。

README

<img width="128" align="right" alt="Logo" src="https://github.com/user-attachments/assets/df5f2840-2f92-4991-aa57-252747d7182e" /> # Heretic: 言語モデルの検閲を完全自動で除去するツール<br><br>[![Discord](https://img.shields.io/discord/1447831134212984903?color=5865F2&label=discord&labelColor=black&logo=discord&logoColo…

查看完整页面