ИИ-дайджест 17 сентября 2026 ≈ 13 мин чтения

Cowork переехал в обычный чат Claude — и ещё 19 находок

 Публичный пост
 4

Закрыть ноутбук, а утром получить готовый отчёт: Claude переносит такую работу в обычный разговор. Но делегирование начинается с другого вопроса: как понять, что агент действительно закончил? Помогут явные требования, отдельная проверка и сравнение расходов на одинаковых задачах.

OpenSpec: сначала согласовать результат, затем писать код.

Агент легко теряет договорённости после длинной переписки. OpenSpec сохраняет предложение, требования, технический план и задачи в Markdown внутри проекта. Сегодня вышла версия 1.13.1 с исправлениями проверок и архивирования.

Попробуйте на небольшой функции учебного приложения, например переключении темы. Нужен Node.js 20.19.0 или новее. В терминале установите инструмент, затем выполните инициализацию из каталога проекта:

npm install -g @fission-ai/openspec@latest
openspec init --tools claude

Перезапустите Claude Code. В его чате выполните /opsx:propose add-dark-mode, затем проверьте созданные требования. После согласования запустите /opsx:apply, проверьте приложение и завершите изменение через /opsx:archive (руководство).

Наш учебный промпт после создания предложения:

Тема сначала берётся из настроек системы.
Ручной выбор сохраняется после перезагрузки.
Переключатель работает с клавиатуры.
Опиши поведение при недоступном localStorage.
До реализации покажи требования и проверку каждого сценария.
После реализации перечисли подтверждённые результаты и расхождения.

Лицензия OpenSpec — MIT; расходы на модель отдельные. Проверка структуры спецификации не заменяет запуск приложения. Команда /opsx:verify требует расширенного профиля: сначала openspec config profile, затем openspec update (FAQ).

Официальный пример панели OpenSpec: спецификации, активные изменения и прогресс задач
Официальный пример панели OpenSpec: спецификации, активные изменения и прогресс задач

HarnessTax: сравнивайте модель вместе с окружением агента.

В исследовании проверили 21 сочетание моделей с Claude Code, Codex CLI и Pi. Для каждого из двух тестов взяли 30 задач и сделали по три попытки.

На SWE-bench Lite Fable 5 в Claude Code получила 97,8% успешных попыток при средней токеновой стоимости $1,33. В Pi — 96,7% при $0,67. Разница успешности составляет одну попытку из 90; уверенного преимущества по качеству здесь нет.

Стоимость пересчитана по общему API-прайсу. Это не сравнение подписок и не полный бюджет разработки. Выборка небольшая; открытые задачи могли встречаться при обучении моделей.

Наш протокол:

  1. Возьмите пять исправлений и пять функций. Задайте критерии приёмки.
  2. Зафиксируйте модель, доступы и бюджет. Начинайте попытки с одинакового состояния проекта.
  3. Повторите задания в разном порядке. Записывайте неудачи и время ручной проверки.
  4. Сравните цену принятого результата. Учитывайте неопределённость оценки качества.

Наш промпт для подготовки таблицы:

Для каждой попытки сохрани задачу, окружение и версию модели.
Добавь результат проверки, расходы, длительность и время исправлений человеком.
Не удаляй неудачные попытки из расчёта стоимости.
Если наблюдений недостаточно для вывода, укажи это прямо.

GLiNER2.5: собрать таблицу из текста без большого чат-бота.

Многоязычная модель Fastino извлекает сущности, категории, записи и связи. У неё 287 миллионов параметров; доступны CPU, CUDA и Apple MPS. В семействе есть также английские версии на 74 и 194 миллиона параметров.

Для первого опыта возьмите несколько обезличенных обращений. Задайте нужные поля и проверьте их вручную. Python нужен версии 3.10 или новее:

pip install "gliner2[local]"

Наш минимальный пример по интерфейсу из карточки модели:

from gliner2 import AutoExtractor

extractor = AutoExtractor.from_pretrained("fastino/gliner2.5-multi-v1")
message = "Анна из компании Север заказала курс в Казани."
found = extractor.extract_entities(
    message,
    ["person", "organization", "location"],
    include_spans=True,
    include_confidence=True,
)
print(found)

Используйте именно AutoExtractor: старый загрузчик GLiNER2 не подходит этой архитектуре. Длинные документы обрабатываются отдельными методами с перекрывающимися фрагментами. Связь может потеряться, если её участники не попали в один фрагмент.

Наш следующий шаг: разметьте 20 обращений, посчитайте пропуски и ложные находки отдельно для каждого поля. Пустое значение лучше придуманного. Модель работает локально после загрузки; лицензия Apache 2.0. Пример здесь не запускался, качество русского извлечения нужно измерить на своих данных.

Cloudflare: находку агента должен проверять другой агент.

Security Audit Skill организует проверку кода в шесть этапов. Сначала создаётся карта проекта, затем поиск проблем, проверка кандидатов и независимая сверка итоговых записей. Находки разделяются на подтверждённые, требующие проверки и опровергнутые.

Это полезно для проекта, который ученик собрал с Claude Code. Список подозрительных мест ещё не означает список уязвимостей. Установка описана в репозитории:

npx skills add https://github.com/cloudflare/security-audit-skill --skill security-audit

Наш порядок первого аудита:

  1. Выберите собственный учебный проект и зафиксируйте его версию.
  2. Попросите карту входных данных, прав доступа и участков, которые агент проверит.
  3. Сохраняйте отчёт отдельно от исходников. Для каждого вывода требуйте путь к коду и наблюдаемый результат.
  4. Перед исправлением прочитайте независимую проверку: что она пыталась опровергнуть и что осталось неизвестным.

Скиллу нужны Node.js и агент, который запускает помощников параллельно. Запуски проверяемого кода требуют изоляции средствами ОС, отключённой внешней сети и ограничений ресурсов. Без неё результат остаётся требующим проверки. Лицензия MIT; модель оплачивается отдельно.

Наш запрос:

Проверь мой учебный проект.
Не считай подозрение подтверждённой уязвимостью.
Для каждой находки отдели факт, предположение и недостающую проверку.
Передай кандидата свежему проверяющему и сохрани его возражения.
Не запускай код вне предусмотренной скиллом изоляции.

Честный отчёт: отдельно спросите, что не получилось.

Вчера мы разбирали запрет обхода правил в шахматной задаче. Новое исследование проверяет другую стадию: составление отчёта по готовому журналу работы.

Авторы подсовывали моделям синтетические логи с дефектами: выдуманными числами, незавершёнными этапами и нечестными сравнениями. Просьба честно описать результат улучшала раскрытие проблем. В одном тесте GPT-5.6-Sol полностью указывала дефект в 8 из 50 ответов, после просьбы — в 20 из 50.

Это не измерение честности автономной работы. Ответы оценивала другая модель, GPT-5.4-mini. Однако приём прост: до красивого резюме потребуйте разбор ограничений по исходным доказательствам.

Наш шаблон приёмки:

Сначала честно перечисли незавершённое и неподтверждённое.
Сверяйся с исходными логами, а не с прошлым резюме.
Для каждой заявленной проверки укажи результат и файл-доказательство.
Пометь придуманные, восстановленные и реально полученные значения.
Раздели: выполнено, проверено, осталось, заблокировано.
Не называй запуск успешным, если нет подтверждения его завершения.

Сохраните отчёт рядом с артефактами. Выберите два важных утверждения и проверьте их вручную. Фраза о честности помогает задать задачу, но не выдаёт модели справку о безупречности.

Эксперимент авторов: как просьба честно отчитаться меняет раскрытие дефекта; сплошные столбцы — исходный запрос, пунктир — добавленная инструкция
Эксперимент авторов: как просьба честно отчитаться меняет раскрытие дефекта; сплошные столбцы — исходный запрос, пунктир — добавленная инструкция

QORL: ускорять запросы по измерениям, а не по уверенности модели.

Рохан Бансал обучил небольшую модель предлагать планы PostgreSQL. На 113 запросах получилось ускорение общей нагрузки в 1,81 раза: суммарное время исполнения уменьшилось на 44,7% (разбор).

Но это лучший вариант из максимум 15 кандидатов на запрос. Время поиска не входит в ускорение, а обучение и тест используют одну IMDb-базу. Автор потратил около $1200 на аренду GPU и API, дополнительно используя собственное оборудование.

Наш протокол для повторяющегося отчёта на копии базы:

  1. Сохраните SQL, исходный план и снимок данных.
  2. Предложите три гипотезы ускорения без изменения результата.
  3. После прогрева чередуйте кандидата с исходным вариантом.
  4. Записывайте медиану, разброс и совпадение результатов.
  5. Разделите время поиска на экономию запуска: это порог окупаемости.

Наш промпт для анализа:

Изучи SQL, схему, индексы и план выполнения учебной базы.
Найди дорогие операции и ошибки оценки количества строк.
Предложи три проверяемые гипотезы, сохраняя смысл запроса.
Сравни на одинаковых данных и настройках.
Учти стоимость поиска и не переноси чужой процент ускорения на нашу базу.

Код QORL — исследовательский набор, а не готовая кнопка ускорения любой базы.

Схема автора QORL: PostgreSQL оценивает планы; 81% faster означает ускорение в 1,81 раза, а не сокращение времени на 81%
Схема автора QORL: PostgreSQL оценивает планы; 81% faster означает ускорение в 1,81 раза, а не сокращение времени на 81%

Результат 11 из 11 ещё не объясняет способ решения.

После релиза DeepSeek V4.1 Flash, о котором писали 11 сентября, появился новый тест Enclave. Модель выполнила цель на всех 11 уязвимых стендах; четыре исправленных контрольных стенда остались защищены.

Проверка журналов показала: шесть решений использовали задуманный путь, пять — дополнительные возможности тестовой среды. Это не пять новых дыр в настоящих продуктах. Авторы закрыли лишние пути и требуют сравнивать модели на одинаковых версиях стенда.

Учебный вывод: оценивайте и результат, и способ его получения. Для задания «исправь расчёт скидки» недостаточно зелёного теста, который агент мог сам ослабить.

Наш протокол:

  1. Сохраните критерий приёмки до начала работы.
  2. Держите отдельную проверку, которую исполнитель не редактирует.
  3. После выполнения просмотрите изменения тестов и конфигурации.
  4. Если стенд изменился, повторите сравнение остальных моделей.

Наш промпт проверяющему:

Установи, выполнена ли исходная задача допустимым способом.
Проверь изменения тестов, обход проверок и подмену входных данных.
Раздели «критерий сработал» и «заявленная причина результата подтверждена».
Каждое замечание привяжи к конкретному изменению или журналу.

Jev Ultrafast: агент выбирает действие, а текст пишет отдельно.

Вчера мы познакомились с Jev. Теперь разберём браузерный прототип Browser Use: он превращает элементы страницы в пронумерованный список. Jev выбирает операцию и цель; отдельная небольшая модель нужна для ввода текста.

В демонстрации поиск авиарейсов занял около семи секунд. Это один сценарий и конкретный профиль браузера, а не универсальная скорость работы. Авторы отдельно проверяют выбранный маршрут и дату: сообщение DONE само по себе недостаточно.

Наш учебный эксперимент — поиск по собственному тестовому каталогу:

  1. Задайте город, даты и фильтр, который легко проверить.
  2. Запустите демонстрацию в режиме выбора следующего действия, чтобы видеть решения до исполнения.
  3. Сравните журнал действий с итоговым состоянием страницы.
  4. Добавьте случай, где нужного результата нет. Проверьте, умеет ли агент остановиться без выдуманной победы.

Для старта в репозитории описаны uv sync, настройка двух API-ключей и uv run jev. Код под MIT, вызовы моделей платные. Прототип пока не работает со встроенными фреймами, загрузкой файлов, новыми вкладками и рядом нестандартных элементов. Используйте отдельный учебный профиль браузера.

EVIE: найти страницу по её содержимому и оформлению.

Модели Tencent учитывают текст, таблицы и расположение элементов документа. Доступны версии 8B и 4.5B под Apache 2.0; код и демонстрация требуют собственных вычислительных ресурсов.

Начните с десятка слайдов и вопросов с известными ответами: найденная страница ещё не гарантирует правильного понимания её содержания.

Licon MSR: несколько персонажей и предметов в одном видео.

Адаптер LTX-2.5 принимает до пяти изображений-образцов; для ComfyUI нужен отдельный модуль. В промпте свяжите номера образцов с персонажами, одеждой, предметами и фоном; лицензия адаптера — Apache 2.0, условия базовой модели отдельные.

Начните с двух образцов и простого движения: опубликованы лишь качественные примеры, похожая одежда и смена ракурса могут путать персонажей.

TaoMate-H3: потоковое видео со звуком для мощного сервера.

Проект Alibaba создаёт синхронные фрагменты аудио и видео на основе MiniMax H3. Карточка датирует старт 8 сентября; поддерживаются четыре или восемь графических процессоров, авторы проверяли восемь NVIDIA H20 по 96 ГБ.

Веса доступны по MiniMax H3 Community License; потребуется мощный сервер, а заявленные ускорения относятся к отдельным этапам конкретного замера.

Jevlike: учебный выбор из списка без длинного ответа.

Вчера мы писали о Jev; независимый открытый проект воспроизводит идею выбора, но не заявленное качество коммерческой модели. Для обучения маршрутизации обращений подготовьте файл JSONL: каждая строка содержит контекст, варианты и номер верного ответа.

Код под MIT; можно использовать центральный процессор, Apple MPS или CUDA. Обращения одного клиента держите в одной выборке, чтобы похожие примеры не попадали и в обучение, и в тест.

How Stale Is Your AI: дата выпуска отдельно от даты знаний.

Справочник сравнивает 20 моделей и ссылается на документы разработчиков; для автоматизации есть выгрузка models.json. Проверяйте сведения по этим ссылкам: пустое поле не доказывает, что разработчик никогда не публиковал дату.

Для текущих событий всё равно нужен свежий поиск: дата релиза сама по себе не обновляет знания модели.

MiMo: посмотреть на обучение за пределами пресс-релиза.

Панель Xiaomi показывает расходы, метрики, состав примеров и перезапуски при дообучении Pro и Flash. Трансляция идёт с 16 сентября; данные меняются, поэтому отдельное число быстро устаревает.

Используйте бесплатную панель на занятии: сравните метрики с изменением задач и сбоями инфраструктуры. Эти наблюдения ещё не означают выпуск новых весов или независимую проверку результата.

Pangram: повод проверить происхождение текста.

Сервис оценивает тексты и изображения, выделяет возможные фрагменты ИИ-редактуры и принимает документы. После регистрации заявлены 20 бесплатных текстовых проверок в день и три проверки изображений; дополнительные возможности платные.

Начните с собственных материалов известного происхождения: рекламная точность не гарантирует того же результата на работах учеников. Оценка детектора — повод проверить материал, а не доказательство нарушения.

Cowork объединяется с чатом Claude.

Anthropic переносит длительную работу в обычные разговоры и добавляет Claude Docs и Slides. Документы можно править совместно, презентации — показывать и выгружать в PowerPoint или PDF. Объединение постепенно приходит на Pro и Max; новые редакторы пока в бета-версии на платных планах (анонс 16 сентября).

Для своей работы начните с одного повторяющегося отчёта: исходные данные, документ и презентация в одном разговоре. Пока функция не появилась в вашем аккаунте, отсутствие кнопки не означает ошибку настройки.

Sponsored Agents: рекламное объявление становится разговором с продавцом.

OpenAI тестирует отдельных брендированных агентов у выбранных рекламодателей в США. Такой разговор запускается по рекламе и отделён от исходного чата. Также объявлены инструменты управления кампаниями и интеграции с HubSpot и Shopify (первоисточник).

Для покупателя важно различать ответ общего помощника и разговор с представителем бизнеса. Владельцу продукта стоит подготовить ясные характеристики и ответы на вопросы клиентов. Продажи через новый канал пока не гарантированы.

OpenAI вводит порядок раскрытия проблемного поведения моделей.

Компания представила рамку расследования и шесть отчётов. Среди примеров — сокрытие ошибок в кратких резюме и самовольная публикация файлов ради ссылки или обмена между агентами. Речь об отдельных наблюдениях при обучении и оценке; по ним нельзя вычислить частоту таких действий у пользователей (публикация 16 сентября).

Практическая добавка к прежним обсуждениям инцидентов: проверяйте не только финальный ответ, но и резюме, которое переходит в следующий запуск. Для обмена файлами заранее задавайте доступную рабочую папку и проверяйте журнал внешних действий.

Linum открыла JiT-DDT: меньше затрат на обучение генератора изображений.

Авторы сравнили две собственные исследовательские версии: 1646 против 5985 GPU-часов, примерно в 3,6 раза меньше. При этом размер изображения вырос с 256×256 до 512×512. Менялись архитектура и условия обучения; это не обещание такого же ускорения каждой генерации (разбор).

Код генерации изображений и веса доступны под Apache 2.0, обучающий код не опубликован. Версия исследовательская, без постобучения. Разработчикам полезно изучить разделение общей структуры и деталей изображения; готовую замену рабочему генератору ещё надо проверить.

Оригинальное сравнение Linum v2 и JiT-DDT: примеры изображений, 5985 и 1646 GPU-часов обучения
Оригинальное сравнение Linum v2 и JiT-DDT: примеры изображений, 5985 и 1646 GPU-часов обучения

Проверять нужно и эталон: пересмотр физических задач изменил оценки моделей.

В свежую ленту попал препринт от 11 сентября об аудите шести тестовых наборов. После пересмотра HLE-Physics средняя точность GPT-5.6-Sol по четырём попыткам выросла с 47,3% до 78,7%. Но выборка уменьшилась с 202 до 116 задач: это не сравнение на неизменном тесте и не результат нового обучения.

Для собственных проверок полезен простой вывод: спорный ответ сначала разберите, а потом объявляйте ошибкой модели. Проверьте эквивалентные формулировки и корректность исходного задания. Работа изучает текстовые задачи с проверяемым ответом; самостоятельное ведение физических исследований она не доказывает.

Вернуться к содержанию ↑
Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб