heretic p-e-w
Fully automatic censorship removal for language models
- 주요 언어
- Python
- Stars
- 28,688
- Forks
- 3,163
태그
- CLI 도구
- 딥러닝
- LLM 파인튜닝
- 로컬 GPU 학습
- AI 평가
요약
Heretic은 게시후 학습 없이 트랜스포머 기반 언어모델의 검열(안전 정렬)을 완전 자동으로 제거하는 CLI 도구입니다. 방향성 절제(abliteration) 기법과 Optuna 기반 TPE 매개변수 최적화를 결합해 거부 응답 수와 원본 모델과의 KL 발산을 동시에 최소화하여, 원본 지능을 최대한 보존하는 무검열 모델을 생성합니다. 복잡한 트랜스포머 내부 이해가 필요 없어 명령줄 사용법만 알면 누구나 사용할 수 있으며, 다중모달 및 MoE 하이브리드 등 대부분의 밀집 모델을 지원합니다.
README
<img width="128" align="right" alt="Logo" src="https://github.com/user-attachments/assets/df5f2840-2f92-4991-aa57-252747d7182e" /> # Heretic: 언어 모델을 위한 완전 자동 검열 제거 도구<br><br>[![Discord](https://img.shields.io/discord/1447831134212984903?color=5865F2&label=discord&labelColor=black&logo=discord&logoC…