Knowledge Graph Extractor
превращает документы, URL и архивы в граф фактов через локальную LLM
Что это
Open-source инструмент, который преобразует произвольные документы, ссылки или ZIP-архивы в интерактивный граф знаний. На вход принимает текст, URL (через Jina Reader) или архивы с файлами разных форматов (txt, md, html, pdf, docx, json, csv, код). Локально развёрнутая LLM (Qwen, через llama.cpp на GPU) извлекает из содержимого атомарные факты в виде троек субъект-предикат-объект, после чего похожие факты дедуплицируются с помощью эмбеддингов jina-embeddings. Результат визуализируется как force-directed граф и выгружается в формате JSONL.
Для участника клуба полезен как референс архитектуры пайплайна извлечения знаний на своём железе: FastAPI-бэкенд, очередь задач на один GPU-слот, OpenAI-совместимый API у llama-server, Docker-контейнеризация. Подходит тем, кто строит собственные RAG-системы, базы знаний или автоматизации по обработке контента и хочет посмотреть готовый пример пайплайна извлечения фактов и дедупликации без обращения к внешним платным API.
Возможности
- принимает на вход текст, URL или ZIP-архив с файлами (txt, md, html, pdf, docx, json, csv, код)
- извлекает URL-контент через Jina Reader
- извлекает атомарные факты (тройки субъект-предикат-объект) с помощью LLM
- семантическая дедупликация похожих фактов через jina-embeddings на CPU
- визуализация результата в виде force-directed графа
- выгрузка извлечённых фактов в формате JSONL
- локальный inference через llama.cpp с CUDA, OpenAI-совместимый API
- разворачивается через Docker и docker-compose, требует GPU NVIDIA L4 24GB
Цена: открытый код, лицензия MIT, без платных тарифов; для работы нужно собственное GPU-оборудование (например NVIDIA L4 24GB)