Что это
Heretic — консольный инструмент с открытым кодом для удаления встроенной цензуры (safety alignment) из открытых трансформер-моделей методом направленной абляции (abliteration). Инструмент автоматически находит и ортогонализирует внутри модели «направление отказа» — вектор, отвечающий за отказы в ответах, — а параметры абляции подбирает автоматически через TPE-оптимизатор на базе Optuna, минимизируя число отказов и одновременно отклонение от поведения исходной модели. Поддерживает большинство плотных моделей, часть MoE и мультимодальных архитектур, а также гибридные модели вроде Qwen3.5; не работает с чистыми SSM-моделями (Mamba и подобными).
Для участников клуба инструмент полезен тем, кто локально запускает открытые LLM (через Ollama, llama.cpp, vLLM) и хочет получить модель без отказов на «спорные» промпты — например, для нестандартных сценариев автоматизации, генерации контента или тестирования агентов, где стоковые safety-фильтры мешают выполнению задачи. Работа полностью автоматическая: не требует понимания внутреннего устройства трансформеров, достаточно уметь запустить консольную программу. Итоговую модель можно сохранить локально или опубликовать на Hugging Face.
Возможности
- Автоматическое удаление цензуры (abliteration) без дообучения модели
- Подбор параметров абляции через TPE-оптимизатор (Optuna) без ручной настройки
- Минимизирует число отказов и одновременно отклонение (KL-дивергенцию) от исходной модели
- Поддерживает плотные модели, ряд MoE-архитектур, мультимодальные и гибридные модели (Qwen3.5)
- Не требует знания внутреннего устройства трансформеров — запуск одной командой
- Обработка модели уровня Qwen3-4B занимает 20-30 минут на RTX 3090
- Поддержка квантизации через bitsandbytes
- Сохранение результата локально или публикация модели на Hugging Face
Цена: открытый код, лицензия AGPL-3.0, установка через pip (heretic-llm), платных тарифов нет