Расширенный разбор мультимодального RAG!

Смотреть урок

Дополнительные файлы из урока

В этом уроке я разбираю расширенную версию мультимодального RAG: как загрузить в базу знаний PDF с картинками, чтобы агент находил изображения по смыслу и показывал их в ответах. Использую OCR от Mistral — за один недорогой проход он отдаёт сразу три компонента: текст документа, сами изображения и текстовые аннотации к ним. Картинки выгружаю на своё S3-хранилище, а аннотации со ссылками встраиваю в чанки так, чтобы при нарезке они никогда не…

🔒

Этот материал доступен участникам Клуба. Войдите или оформите доступ, чтобы читать целиком, открывать видео и комментировать.

Войти Вступить / купить доступ