Knowledge Graph Extractor

превращает документы, URL и архивы в граф фактов через локальную LLM

github.com ↗
 Публичный пост

Что это

Open-source инструмент, который преобразует произвольные документы, ссылки или ZIP-архивы в интерактивный граф знаний. На вход принимает текст, URL (через Jina Reader) или архивы с файлами разных форматов (txt, md, html, pdf, docx, json, csv, код). Локально развёрнутая LLM (Qwen, через llama.cpp на GPU) извлекает из содержимого атомарные факты в виде троек субъект-предикат-объект, после чего похожие факты дедуплицируются с помощью эмбеддингов jina-embeddings. Результат визуализируется как force-directed граф и выгружается в формате JSONL.

Для участника клуба полезен как референс архитектуры пайплайна извлечения знаний на своём железе: FastAPI-бэкенд, очередь задач на один GPU-слот, OpenAI-совместимый API у llama-server, Docker-контейнеризация. Подходит тем, кто строит собственные RAG-системы, базы знаний или автоматизации по обработке контента и хочет посмотреть готовый пример пайплайна извлечения фактов и дедупликации без обращения к внешним платным API.

Возможности

  • принимает на вход текст, URL или ZIP-архив с файлами (txt, md, html, pdf, docx, json, csv, код)
  • извлекает URL-контент через Jina Reader
  • извлекает атомарные факты (тройки субъект-предикат-объект) с помощью LLM
  • семантическая дедупликация похожих фактов через jina-embeddings на CPU
  • визуализация результата в виде force-directed графа
  • выгрузка извлечённых фактов в формате JSONL
  • локальный inference через llama.cpp с CUDA, OpenAI-совместимый API
  • разворачивается через Docker и docker-compose, требует GPU NVIDIA L4 24GB

Цена: открытый код, лицензия MIT, без платных тарифов; для работы нужно собственное GPU-оборудование (например NVIDIA L4 24GB)

Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб