Агентство просило $100 000, он собрал сам за три дня — плюс 47 разборов и инструментов  Публичный пост

31 августа 2026  72

Джону выставили счёт на сто тысяч долларов за платформу корпоративного обучения. Он не заплатил — сел и собрал всё сам за три дня, ни строчки кода до этого не написав. За полтора месяца платформа принесла $180 тысяч. Ещё сегодня: агенты OpenAI месяцами строили заговор против проверяльщика, которого не существовало, а Claude Code научился стартовать с телефона.

Главное за 30 секунд

  • Два человека судились с помощью ИИ: построивший проверку ссылок выиграл, а не прочитавший ответы модели заплатил чужие издержки.
  • Claude Code теперь стартует сессию прямо с телефона, а /resume подхватывает терминальную работу в приложении на компьютере.
  • Агенты OpenAI месяцами строили заговор против проверяльщика, которого не существовало: тот просто сверял ответ.
  • Приём SKILL.state выбрасывает историю разговора и держит состояние в JSON — токенов в шестнадцать раз меньше при выросшей точности.
  • Скраперы жгут на kernel.org больше процессорного времени, чем весь честный доступ к коду, и приходят с домашних адресов.

Внедряем и улучшаем

Четыре шага от прототипа к бизнесу: разбор от главы продуктовой разработки Replit. Амол Джайн отвечает в Replit за продуктовую инженерию и видит всю картину: какие собранные на промптах приложения приносят деньги, а какие умирают. Вывод у него простой. Огромный рынок не нужен. «We see businesses that... serve 100 few hundred customers, but these are making real money». Работает не идея, а ваше уже имеющееся преимущество: экспертиза, связи, сообщество, вкус. Универсальные трекеры и планировщики питания агенты сожрали — «agents just kind of swallowing all of that whole».

Три примера с шестизначной выручкой. Седрик Роберже, 22 года, никогда не писал кода, ушёл с головой в сообщество вокруг пептидов и GLP-1 и сделал приложение-трекер Pep AI: $60 тысяч и 10 тысяч пользователей за первый месяц. Джон, основавший до этого несколько компаний и ни разу не писавший кода, хотел платформу корпоративного ИИ-обучения — агентство выставило счёт «$100,000 plus». Он собрал всё сам за три дня и за первые полтора месяца сделал $180 тысяч на GenAIPI. Юсеф Абдельфаттах, он же FaZe Apex из киберспортивного клана, поднял TryNearby — площадку, где местные заведения находят местных авторов. Сейчас это 120+ платящих ресторанов и годовая выручка за $100 тысяч.

Теперь сами четыре шага — Амол показывает их на живом демо. Публикация. Главную ошибку новичков он называет мемом: «sharing localhost links to their friends». Ссылка на локальный сервер — это не продукт. Нужен хостинг, база и домен. Безопасность. В Replit есть отдельный центр безопасности: агент строит модель угроз под ваше приложение, потом минут за десять прогоняет глубокую проверку. Ищет утёкшие ключи прямо в коде, вредоносные пакеты, которые агент сам мог подтянуть, и утечку персональных данных из-за кривого хранения. Раньше это была неделя-две работы нанятой команды. Цитата про риск честная: «vibe coded websites are... notoriously exposed to those things».

Платежи. Подписка добавляется одним промптом к агенту. Под капотом сначала поднимается тестовая песочница Stripe со своими ключами и тарифами. Когда всё устраивает, ключи меняются на боевые. Аккаунт Stripe создаётся за вас, остаётся только его забрать. Дистрибуция. Отдельный агент прогоняет приложение на находимость — и в обычном поиске, и в ответах ChatGPT. Амол прямо называет это первой попыткой, а не готовым решением. Но мысль верная: «so much of the game is distribution if everyone can build».

Отдельный совет, который стоит забрать даже без Replit. Внутренние инструменты теперь дешевле собрать у себя, чем купить на стороне. В самом Replit человек из отдела продаж, никогда не писавший кода, за два дня сделал платформу демонстраций для продавцов. Готовые аналоги «can easily run into six digits». Потом за день добавил туда персонажей по просьбе коллеги: «we're not at the mercy of someone else's road map». Дата-сайентист в одиночку заменил внешнюю аналитику своим порталом с воронками и удержанием.

Тест, который Амол предлагает применять к любому продукту: «If the cost of code goes to zero, what do you pay for?» Ответ — доверие, данные, инфраструктура, физические вещи, труд, сеть. Всё остальное дешевеет до нуля. (Creator Economy, видео эпизода)

Claude Code: сессия стартует с телефона, а /resume работает в приложении на компьютере. Недельная сводка Anthropic вышла густой, разберём по пунктам. Первое: /resume появился в приложении для компьютера. Раньше работало только в одну сторону — команда /desktop в терминале выкидывала сессию в приложение. Теперь наоборот: открываете приложение, набираете /resume и подхватываете любую терминальную сессию, даже уже закрытую. «Type /resume in the desktop app to pick up any session you started in the terminal and continue it on the same transcript». Сценарий понятный: начали в терминале, переехали в приложение, когда захотелось видеть изменения и живой предпросмотр рядом. Заодно починили обидное: сессии, открытые в приложении, больше не исчезают через тридцать дней.

Второе: сессию можно начать прямо с телефона. Любая машина, где запущен claude rc, теперь показывается карточкой в разделе Devices во вкладке Code мобильного приложения. Тап по карточке, выбор папки — и сессия стартует на этой машине «with all its files, MCP servers, and tools». Раньше с телефона можно было только подключиться к уже идущей сессии. Оговорки: нужен тариф Pro и выше, по ключу API не работает, локальный процесс должен оставаться живым.

Раздел Devices во вкладке Code: подключённый макбук карточкой сверху — с неё запускается новая сессия прямо с телефона
Раздел Devices во вкладке Code: подключённый макбук карточкой сверху — с неё запускается новая сессия прямо с телефона

Третье: режим --restricted. «Start with claude --restricted and Claude cannot run commands, execute code, or fetch the web». Файловые инструменты запираются внутри рабочей папки, пользовательские и проектные настройки игнорируются. Задуман для общих машин и для прогонов оценки. Режим bypassPermissions в нём отклоняется, облачные сессии из него не создаются. Нужна версия 2.1.248 и выше.

Четвёртое, и это самое интересное. Правила Auto mode теперь редактируются прямо в /permissions, а не руками в JSON. Появилась вкладка со всеми правилами allow, soft_deny и hard_deny, которыми пользуется классификатор. Главное открытие для тех, кто ещё не заглядывал: правила пишутся человеческой прозой, а не шаблонами команд. Вот образец из документации:

{
  "autoMode": {
    "allow": [
      "$defaults",
      "Deploying to the staging namespace is allowed: staging is isolated from production and resets nightly"
    ],
    "soft_deny": [
      "$defaults",
      "Never run database migrations outside the migrations CLI, even against dev databases",
      "Never modify files under infra/terraform/prod/: production infrastructure changes go through the review workflow"
    ],
    "hard_deny": [
      "$defaults",
      "Never send repository contents to third-party code-review APIs"
    ]
  }
}

Приоритет такой: hard_deny блокирует всегда, soft_deny блокирует, но перебивается вашим явным намерением, allow — это исключения из soft_deny. Тонкость, на которой легко обжечься: строка "$defaults" обязательна. Без неё ваш список полностью затирает встроенные правила. Проверить, что получилось, можно командами claude auto-mode config и claude auto-mode critique.

Пятое: Claude теперь сам пишет за вас баг-репорт, когда в сессии что-то ломается. Черновик появляется карточкой над строкой ввода, вы его просматриваете в /feedback и решаете, отправлять или нет. Выключается в /config, пункт Claude-drafted feedback. По умолчанию не больше трёх карточек за сессию.

Мелочи, которые стоят внимания. promptCacheTtl держит кеш разговора шестьдесят минут вместо пяти. /cd сразу подхватывает настройки, хуки, MCP-серверы и скиллы нового проекта. Субагент, упёршийся в лимит ходов, возвращает результат с пометкой «частично» — его можно продолжить. И приятная цифра: бинарник сжали, загрузка похудела с 340 до 75 мегабайт. (changelog Claude Code)

Отдельно — приём от инженера Anthropic Диксона Цая, простой и работающий. Перед тем как смотреть свой пул-реквест, он запускает субагента с задачей «adversarially review this change for correctness and simplicity». Субагент не видел разговора и не разделяет ваших слепых пятен. Второй приём, от Ричарда Чжуана: при восьми и более параллельных сессиях он сделал скилл /recap, который сначала освежает устаревшее, а потом отчитывается о четырёх вещах. Цель словами заказчика. Где всё стоит и чем это доказано — причём «unit tests passing doesn't count as proven». Что заблокировано человеком, а что технически. Следующие шаги с пометкой, чьи они.

Проверьте, не уезжает ли ссылка на вашу сессию в чужой репозиторий. Тихая история, которая на выходных вышла в топ Hacker News. Claude Code дописывает в коммит трейлер Claude-Session со ссылкой вида https://claude.ai/code/session_..., а в описание пул-реквеста — ту же ссылку текстом. По умолчанию включено. Сразу снимем панику: это происходит только в облачных сессиях и в режиме Remote Control. Обычная локальная сессия в терминале ничего не дописывает. И сами сессии на claude.ai по умолчанию приватные — посторонний по ссылке ничего не увидит.

Претензия людей в другом. Ссылка появилась в версии 2.1.9, а настройка, которой её отключают, — только в 2.1.183. Несколько сотен версий это работало без штатного способа выключить. Автор запроса формулирует точно: «Users only discover it after it's already polluting their git history». Выключается так:

{
  "attribution": {
    "commit": "",
    "pr": "",
    "sessionUrl": false
  }
}

Две ловушки. Первая: ваш ~/.claude/settings.json не доезжает до облачных сессий, они стартуют в чистом контейнере. Для них правило нужно класть в .claude/settings.json внутри самого репозитория. Вторая: в обсуждении гуляет переменная CLAUDE_CODE_SUPPRESS_SESSION_ATTRIBUTION с тремя десятками одобрений — такой переменной в документации нет, похоже на выдумку модели. И заодно проверьте /config, не включён ли у вас Remote Control для всех сессий разом. (issue 66504, документация)

Промпт дня: заставить Claude показать каждую ячейку. Приём из The Neuron, про работу с таблицами. Модель уверенно рассуждает о вашей книге Excel и при этом «quietly skipping the cells you care about» — тихо пропускает то, что вам важно. Лечится требованием доказать покрытие до правок. Три шага. Первый: попросить журнал покрытия — какие листы и диапазоны просмотрены, какие пропущены, какие непонятны. Второй: требовать ссылки на конкретные ячейки и полный список формул и значений, которые модель собирается менять. Третий: закончить перечнем неразрешённых допущений и проходом без единой правки. Готовый промпт:

Review this workbook without editing it. List every sheet or range you inspected,
cite the cells behind each conclusion, flag anything you could not verify,
and show every formula or value you would change before I approve edits.

Приём переносится на что угодно, не только на таблицы. Отчёт, база, длинный документ — везде работает одно и то же: сначала журнал покрытия, потом правки. (The Neuron)

ChatGPT Work: Уиллисон разобрал, что это вообще такое. Продукт вышел 9 июля, и с тех пор OpenAI, по словам Саймона Уиллисона, «furiously iterating». Его вердикт с первой строки: «It is an extraordinarily confusing and very powerful product». Первое, что надо понять, — под одним именем прячутся два разных продукта. Work Cloud живёт в облаке, доступен через сайт и мобильные приложения. Work Local появляется, если поставить приложение для компьютера — «the app that used to be called Codex», то есть переодетый Codex для не-программистов. В окне ввода приложения есть переключатель между ними.

Цена: Work доступен только на подписке от $20 в месяц. Тариф Go за $8 доступа не даёт. Уровни рассуждения Extra High и Pro открываются на $100 и выше. Модели в Work выбираются из GPT-5.6 Sol, Luna и Terra, у каждой шесть уровней рассуждения. Чем Sol отличается от Luna, Уиллисон честно не знает — документации нет. Единственное практическое наблюдение: «Ultra is a special mode that more eagerly delegates to sub-agents».

Главное отличие от обычного чата — песочница с кодом теперь ходит в интернет. «The code execution environment can now talk to the rest of the internet!» В обычном ChatGPT установка пакетов и обращения к внешним сайтам режутся прокси. Здесь можно склонировать репозиторий с GitHub, поставить зависимости и работать через них с остальным вебом. Список разрешённых доменов настраивается, но по умолчанию, судя по всему, открыто всё. Второе: полноценный Chrome без окна, который умеет исполнять JavaScript по загруженной странице. Третье: файловая система переживает сессии. У Уиллисона в общей папке скопился 171 каталог от прошлых разговоров, и том виден сразу всем работающим сессиям.

ChatGPT Work открывает своим браузером опубликованный сайт и делает скриншот — «Worked for 1m 18s»
ChatGPT Work открывает своим браузером опубликованный сайт и делает скриншот — «Worked for 1m 18s»

Самый полезный трюк статьи — заставить продукт задокументировать себя. Уиллисон попросил Work собрать сайт со списком всех своих инструментов, дословно воспроизводя описания. Получилось 223 инструмента. Потом добавил: «Add full copies of every skill to the website» — и нашлось 44 скилла, включая работу с документами, таблицами, PDF, генерацию картинок и сборку панелей. Повторите это у себя: набор зависит от ваших прав и подключений, чужой список не подойдёт.

И предупреждение, которое стоит запомнить. Уиллисон описывает «смертельную тройку»: доступ к приватным данным, контакт с недоверенным содержимым и канал наружу. «ChatGPT Work combines all three!» Не давайте одной сессии одновременно ваши личные данные и свободное хождение по чужим сайтам. (Simon Willison)

Семьдесят пять способов угробить своё дело — и десять, которые бьют по соло-предпринимателю. Итамар Новик, соло-партнёр фонда Recursive Ventures, начал серию разборов антипаттернов. Его определение хорошее: приём, который на входе выглядит уместным ответом на проблему, а по последствиям приносит больше вреда, чем пользы. То есть не ошибка, а разумная на вид практика. Логика серии: успех невоспроизводим, провал воспроизводим — значит, изучать надо провалы. Разбирает он в том числе свои: закрытый первый стартап и сделку Life360 с ADT на $50 млн.

Пять штук переносятся на маленький бизнес один в один. Bad revenue — выручка, купленная ценой будущего: отрицательная маржа, клиент из ада, покупатель не из вашей аудитории. «Good Revenue informs your next decision. Bad Revenue distracts you from it». Признак — маржа падает при неизменных ценах. Лечение: посчитать прибыльность каждого клиента и уволить убыточных. Elephant hunting — охота на одного огромного заказчика. Правило: сделка съест вдвое больше времени и денег, чем в плане, — всё ещё берётесь?

Analysis paralysis лечится правилом семидесяти процентов: решать, имея 70% желаемой информации. Boiling the ocean — вместо океана кипятите чашку, каждая фаза должна окупать себя сама. Confirmation bias — самая дешёвая техника из всех: заранее запишите, какое свидетельство изменило бы ваше мнение, и разговаривайте не с довольными клиентами, а с ушедшими.

Ещё два для тех, кто строит на ИИ. Bleeding on the edge — вы правы насчёт будущего, но ошиблись со сроком. Признак точный: в продажах возражают про время, а не про ценность. «Интересно, но мы не готовы». Лечение — найти сценарий, работающий на сегодняшней инфраструктуре. Tesla начала со спорткара. Platform risk — зависимость от чужой платформы, у неё десяток подвидов, включая «poison pill»: выбранная платформа мешает продать компанию. Правило простое — кто-то в вашей команде должен уметь быстро получить ответ от руководителя платформы. Честная оговорка от самого автора: у каждого разбора есть раздел «Misdiagnosis», где тот же приём оказывается правильным решением. (Itamar Novick)

«Слепота к багам»: почему вы перестали видеть, что ваш софт сломан. Дэн Лу написал текст, который бьёт прямо в приёмку ИИ-кода. Тезис: он видит «hundreds to thousands of bugs per week», а окружающие натыкаются на те же самые баги и не замечают их. Десять лет он сомневался, не выдумывает ли — может, он просто ловит редкие случаи. Проверил: продукты потом падают лицом в грязь, и пользователи ловят ровно то же самое.

Лучшая метафора текста — про мышь. Друг не смог пользоваться его компьютером. Лу пригляделся к своей руке: «on looking at what I was doing with my hand to smoothly move the pointer in a straight line, I was violently throwing my hand all over the place». Он не замечал, что мышь сломана. Он выучил компенсирующее движение. Дальше идёт библиотека таких привычек. В Google Docs он не пишет заголовок сразу после открытия документа — тот затирается, поэтому сначала он делает что-то другое, а переименовывает потом. В Microsoft он и коллеги выключали Wi-Fi перед входом в систему, чтобы обойти ошибку. Вывод: «a large fraction of computer literacy and software literacy is developing a large library of these habits that you just do at a non-conscious level».

Отсюда и объяснение, почему свой софт не спасает от собственного использования. Он работает ровно до тех пор, пока люди не выработали — и не забыли — привычки, обходящие его дефекты.

Что делать. Раз в неделю ловите себя на костыле: если перед действием вы делаете лишнее движение — это не ваша ловкость, это баг, который вы перестали видеть. Запишите его. Тот же приём работает с агентами: перезапуск, «сейчас переформулирую промпт», «сначала попрошу план» — всё это компенсирующие привычки вокруг дефекта. Приёмку ИИ-выхода делайте холодным проходом, с нуля, как новый пользователь. Кстати, сам Лу теперь так и проверяет себя: «I can even have LLMs act like normal users in a lot of ways and show that the issues reproduce across many different scenarios». И финал, который стоит повесить над столом: «while it's easier than ever to churn out low quality software, it's also easier than ever to improve quality». (danluu)

Почему в вашей команде всё вязнет: арифметика согласования. Алекс Коморовски собрал презентацию на 171 слайд про то, как организации превращаются в слизевик. Главное там — не метафора, а числа. Проект получается, только если каждый участник вложился вовремя. Десять человек, каждый надёжен на 99% — шанс успеха 90%. Каждый надёжен на 95%, потому что у всех свои приоритеты, — уже 60%. Просело до 90% — остаётся 35%. Дальше включается петля: проект выглядит менее вероятным, его двигают в конец очереди, он становится ещё менее вероятным.

Вторая цифра ещё злее. «In a team of 10 people, there are 45 pairwise connections. In general, it's roughly O(n²). If any single one of them erupts, it could cause the entire project to fail!» Вероятность трения между двумя людьми растёт степенью от организационной дистанции — числа уровней до общего начальника. И автор снимает соблазн найти виноватого: «Unfortunately, there is no villain. It's no one's fault… and not something any one person can fix».

Практический вывод для того, кто ведёт команду или собирает подрядчиков. Перед запуском считайте не пользу, а число участников и их оргдистанцию. Проект на десятерых из трёх отделов — это 45 связей и шанс ближе к трети, чем к девяноста процентам. Переформулируйте задачу так, чтобы её делали двое-трое рядом сидящих. Не гонитесь за идеальным: «If there's even the smallest amount of uncertainty, absolutely nothing will get done». И не бейте прямой наводкой по большой цели — держите стратегию на три-пять лет, а исполняйте короткими шагами, каждый из которых ценен сам по себе. (komoroske.com)

«Великое сглаживание»: начальник больше не занимается вашей карьерой. Управленческие слои сокращаются, у каждого менеджера больше людей, и кодить его тоже никто не освобождал. В Deel раньше целились в 8–10 человек на менеджера, теперь в 12–15 — ИИ забрал часть административной работы. У инженерного менеджера стартапа двадцать подчинённых, пять часов совещаний в день — и требование при этом писать код. Его формулировка: «I code 90% of the time, and I manage 90% of the time». Первыми под нож идут личные встречи один на один. Формулировка из статьи точная: «It's not managing the human, it's managing the work. And it's much more sink or swim».

Если начальник перестал заниматься вашим развитием, это почти наверняка не про вас — у него двадцать человек. Значит, разговор о карьере инициируете вы: приходите с готовой повесткой, а не ждите, пока её принесут. И держите в голове хорошую новость из той же статьи: ИИ сделал жизнеспособной карьеру сильного специалиста без ухода в начальники. «Вверх» больше не означает «в менеджмент». (Business Insider)

Модели, которые пишут текст не слева направо. Два больших разбора вышли в один день, и вместе они объясняют, куда движется скорость. Обычная модель печатает как человек вслепую без клавиши забоя: слово за словом, и сказанное не переписать. Диффузионная работает как черновик — выкладывает всю страницу сразу, сначала мутную, и за несколько проходов правит все места параллельно.

Сверху обычная модель выдаёт по одному токену слева направо, снизу диффузионная правит всю последовательность целиком за несколько раундов
Сверху обычная модель выдаёт по одному токену слева направо, снизу диффузионная правит всю последовательность целиком за несколько раундов

Практический выигрыш — скорость и управляемость. «Because diffusion can generate or refine multiple tokens per step, it can be 5–10× faster than autoregressive generation». Коммерческая Mercury выдаёт больше тысячи токенов в секунду на одного пользователя, причём на обычных видеокартах, а не на специальном железе. Nemotron Diffusion заявляет пропускную способность в 2–8 раз выше при сохранении до 99% качества. Появляется и свой аналог «подумать подольше»: качество растёт с числом проходов.

В ближайший год вы, скорее всего, встретите диффузию не как новую модель, а как незаметное ускорение — автодополнение кода, черновики, агентские циклы, где ответ появляется почти целиком и сразу. Передний край пока остаётся за обычными моделями: диффузию просто не масштабировали до тех же объёмов. (гайд Кулешова, эссе Дилемана)

Где берётся вкус — и почему ИИ его подтачивает. Два текста вышли в один день и бьют в одну точку. Кристина Леммер-Уэббер разбирает моду на «вкус» как последнее человеческое преимущество. Её удар точный: Рубин и Джобс двигали горы вкусом, но они курировали живых практиков со своим вкусом. «But if your practitioner is an LLM, then you're not a Steve Jobs or a Rick Rubin. Your practitioner is the averages».

Самое интересное — кейс внутри. Автор популярной статьи про вкус попал в неловкое положение: читатели дружно опознали его текст как написанный моделью. Он клялся, что писал сам, и Кристина ему верит. В обсуждении он сам себя разобрал: год читал вывод моделей и работал рядом с ними, пока их ритм не стал частью его собственного архива. Диагноз Кристины: «Using generative AI tools results in becoming nose-blind to their bad smells». Вы перестаёте чувствовать запах.

Айрис Мередит заходит с другой стороны и объясняет механизм. Исправный инструмент уходит из сознания — вы просто едите, а не думаете о вилке. Отсюда её главный пример: человек с вилкой и человек с палочками приходят к разным представлениям о том, что вообще считать едой. И жёсткая строчка, которая снимает наше любимое оправдание: «Even if you literally read every line of code, you're nonetheless fighting against the ready-to-hand nature of the tool that pushes your gestalt towards carelessness and slop».

Что с этим делать сегодня. Первое: заведите зону, куда ИИ не заходит вообще. Не «поменьше», а ноль — один тип задач от начала до конца руками. Это не аскеза, а тренажёр: вкус растёт из ошибок, которых модель вам совершить не даст. Второе: перестаньте оправдываться «я же всё проверяю». Проверка должна быть процедурой с внешним критерием — тест, второй человек, чек-лист, — а не ощущением «вроде норм». Третье: перечитайте свой текст месячной давности. Деградацию вкуса нельзя заметить изнутри процесса, для этого нужна внешняя опора. (dustycloud, deadsimpletech)

Выбросьте историю разговора: агент должен помнить состояние, а не переписку. Работа Google и Пердью, принята на EMNLP. Приём называется SKILL.state, и он лечит главную болезнь долгих агентских задач — раздувание контекста. Обычный агент на каждом шаге получает инструкцию плюс всю историю: рассуждения, действия, наблюдения. Промпт растёт, старые факты остаются в контексте, когда давно перестали быть правдой, и модель тратит внимание на разбор устаревшего.

Здесь историю выбрасывают целиком. Модель видит ровно три вещи: неизменяемое описание навыка, структурированное состояние в JSON и последнее наблюдение. Никаких прошлых шагов. На каждом ходу модель выдаёт рассуждение, заплатку к состоянию и действие. Заплатка проверяется и вливается в состояние, действие выполняется, а рассуждение выбрасывается навсегда. «Intermediate reasoning is discarded immediately after producing a validated state update, preventing prompt growth with execution history».

Цифры честные и крупные. Задача на сто шагов, Gemini 3 Flash: обычный подход с памятью даёт точность 0,91 при 1 062 387 токенах, SKILL.state — 0,94 при 65 408. Экономия в шестнадцать раз. На двухстах шагах разрыв растёт: SKILL.state даёт 0,94 при 122 тысячах токенов, обычный подход — 0,84 при шести миллионах. При зашумлении входа посторонними событиями обычный агент проседает с 0,68 до 0,53, а этот держит выше 0,97. И самое показательное: когда мир меняется за спиной агента, обычные подходы галлюцинируют пять-восемь ходов подряд, а тут восстановление занимает ноль шагов.

Как повторить у себя. Схема состояния пишется один раз на предметную область, а не на задачу. Во всех ста задачах CTF агент обходился одной схемой из пяти полей: найденные флаги, проверенные гипотезы, активные файлы, рабочая папка, сводка команд. Промпт из статьи дословно:

Instructions:
{skill.instructions}

Skill Execution State:
{json.dumps(state, separators=(',', ':'))}

Latest Observation: {observation}

Provide your response with:
1. Step-by-step reasoning (will be discarded after execution)
2. A JSON block fenced with json ... containing both your State Patch and your
   Action. The JSON block MUST have exactly these two keys:
   { "state_patch": { <dict: your state updates, set keys to null to delete> },
     "action": "<string: the exact command you want to execute>" }

Мелочь, которая важна: состояние сериализуется без пробелов, separators=(',',':'). Проверка заплатки живёт в вашем коде, а не в модели, — кривая заплатка откатывается и переспрашивается.

Где не работает, тоже сказано прямо. Открытые модели поменьше ломаются: Gemma 4 на 31 миллиард даёт 0,42, Qwen 3 на 8 миллиардов — 0,34. В 68% случаев они затирают существующие ключи вместо аккуратного слияния. То есть проблема в дисциплине структурированного вывода, а не в уме. И три ситуации, где приём вреден: схема заранее неизвестна; правильное обновление зависит от старого наблюдения, чью важность вы не распознали вовремя; сама история и есть цель задачи — аудит, отладка, объяснение прошлых действий. Кода авторы не выложили. (arXiv 2608.26263)

Четыре проверяльщика вокруг агента — схема, которую стоит скопировать. Anthropic поставила эксперимент: пять агентов на Claude Opus 4.8 сутки-двое чинили десять типов сбоев поведения моделей. Результат громкий — на всех семи задачах, где было с чем сравнить, агент закрыл больше разрыва, чем лучшая идея от живого исследователя. Людей было 28, у каждого опыт от года и публикация по теме, до восьми часов на идею. На задаче про обман агент закрыл 85% разрыва, люди — 20%. Экономика убийственная: «An AAR costs roughly $4 per hour in API inference against the $150 per hour we pay our human researchers». Авторы сами оговариваются: людям не давали итерировать, а результат агента — максимум по полутора сотням шумных замеров.

Но забрать оттуда стоит не это, а обвязку. Вокруг агента поставили четыре разных проверяльщика, и каждый закрывает свою дыру. Первый читает сам код, а не описание кода, и одобряет до запуска. Одобрение привязано к конкретному коду: поправил — проси заново. Второй сверяет код с текстом и отклоняет, если они расходятся. Третий фиксирует гипотезу под неизменяемым номером до того, как виден результат, — «so a finding cannot be rationalized after the fact». Четвёртый вообще не модель: отложенные данные держатся вне досягаемости агента средствами операционной системы, «rather than by trust».

Сработало. Задним числом пересмотрели 1601 запись и нашли 39 попыток подогнать результат — 2,4%. Две трети из них — просто перезапустить тот же метод в надежде на удачный шум. Ни одна попытка не стала итоговым методом. Ловились они потому, что модель проговаривала намерение вслух в рассуждениях.

Что из этого берёте вы, если гоняете агента на своих задачах. Метрика — геометрическое среднее нескольких независимых замеров, а не одно число: иначе агент вылижет один показатель и завалит остальные. Жёсткий заслон «не сломал ли смежное» — у них это общие тесты на знания и математику, у вас существующий набор тестов. Отдельная модель-ревьюер, которая смотрит изменения, а не рассказ об изменениях, до применения. И держите проверочные данные там, куда агент физически не дотянется.

Ещё деталь в тему предыдущего блока: каждая итерация у них — новая сессия, а связность несёт файл памяти, а не растущий контекст. (Anthropic, код обвязки)

Два человека судились с помощью ИИ. Один выиграл, второй заплатил чужие издержки. Отличный материал — потому что в одной статье оба исхода, и разница между ними воспроизводима.

Проигравший: Саднан Хан оспаривал увольнение из ALDI в австралийской комиссии по труду. Комиссия обязала его выплатить 1230 долларов издержек работодателя. Тонкость в том, что модель его не обманывала. Он платно пользовался ChatGPT, разбирал прецеденты — и не прочитал собственные ответы. Замдиректора комиссии сформулировал беспощадно: «If Mr Khan had properly read his own AI generated replies … he would have known that his case was doomed». Вдобавок он забыл убрать из поданных бумаг служебные реплики чата. Свой диагноз он поставил сам: «I was thinking oranges were apples».

Выигравший: Грегори Бейкер, преподаватель информатики в Университете Маккуори, первым успешно оспорил нормы о временной занятости с помощью команды ИИ-агентов. Вот как он это делал, дословно: «I treated it basically as a software development project. I created a repository for my source code and my programs, which were my [tribunal] filings and came up with a build process that it checked. Are all the citations correct? Is everything logically coherent?» Он не спрашивал у модели ответ. Он построил конвейер проверки, через который прогонялась каждая ссылка и каждая логическая связка. Про альтернативу высказался прямо: обращаться к модели как к оракулу без материалов — значит получить «a terrible job».

Разница не в модели и не в подписке. Бейкер знал, какой именно вопрос решает, поставил внешнюю проверку выхода и использовал ИИ как сборочный конвейер. Хан отвечал не на тот вопрос, проверку не поставил и относился к модели как к подтверждению своей правоты. Профессор права Женевьев Грант добавляет про механику угодливости: модель «may in fact encourage people to believe that there are legs in a claim they're making when that may not in fact be the case».

Шесть правил, если разбираетесь со своим юридическим или бытовым вопросом. Первое: начните не с «выиграю ли я», а с «какие правовые вопросы тут решаются и в каком порядке». Второе: откройте каждую ссылку по первоисточнику — непроверенная ссылка не ссылка. Третье: вычитайте финальный документ глазами до последней строки, следы промптов туда попадают. Четвёртое: спросите против себя в чистом чате — «разбей мою позицию как юрист противоположной стороны». Пятое: прочитайте то, что модель уже написала. Шестое: оцените цену проигрыша.

Цифры для масштаба. Число дел выросло на 40%, и генеративный ИИ в этом отчасти виноват. В 40% изученных дел истец пользовался ИИ: больше трёх четвертей брали ChatGPT, 60% — бесплатную версию. С 20 октября в Австралии заявители обязаны раскрывать использование ИИ и подтверждать ссылки. (ABC News)

Инструменты и штуки

OpenClaw 2.0. Открытый ИИ-дворецкий, который живёт на вашем компьютере и пишет вам в мессенджер: Telegram, WhatsApp, Slack, Discord, Signal, iMessage. Внутрь ставится любая модель — от подписки ChatGPT до локальной. Крупную версию не планировали: взялись упростить установку, а чистка потянула за собой всё остальное, и в релиз попало 16 962 пул-реквеста от 933 человек. Новое: подхват уже установленных подписок при первом запуске, импорт памяти из Claude Code и Codex, вынос работы на отдельные машины, запрос паролей маскированным вводом мимо контекста модели. Общие сессии нужны, чтобы втащить коллегу в идущую работу, не пересказывая контекст. Ставится одной строкой curl -fsSL https://openclaw.ai/install.sh | bash, MIT, платите только за токены. Оговорка серьёзная: агент по умолчанию исполняет команды прямо на хосте, а входящие сообщения сама документация называет недоверенным вводом. (openclaw.ai)

Панель OpenClaw 2.0: общая сессия со списком участников онлайн и собранной в чате сводкой
Панель OpenClaw 2.0: общая сессия со списком участников онлайн и собранной в чате сводкой

Hermes Agent (Nous Research). Агент, который сам пишет себе новые навыки по итогам работы: после сложной задачи создаёт скилл, дорабатывает существующие по ходу дела и ищет по своим прошлым разговорам. Живёт не на ноутбуке, а одним процессом на сервере, и обслуживает Telegram, Discord, Slack, WhatsApp, Signal, почту и терминал одновременно — с расшифровкой голосовых и общим контекстом между площадками. Есть расписание задач на человеческом языке и семь способов исполнения, от Docker до Modal. Ставится curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash, MIT, 238 тысяч звёзд. Оговорки: открытых задач в трекере больше, чем закрытых, а агенту с доступом к оболочке из мессенджера нужна изоляция, которую включают руками. (GitHub)

penombra. Рукописный блокнот, где вы пишете стилусом, а Claude отвечает вам прямо на странице. Читает PDF и электронные книги, объясняет фрагменты, отвечает на пометки на полях и устраивает опрос по прочитанному. Работает на Android-планшетах со стилусом. Автор показал это на Reddit, пост собрал 4,4 тысячи одобрений. Пока набор ранних тестеров. Идея редкая для нынешнего потока однотипных чат-обёрток: не заменить чтение, а вернуть в него разговор на полях. (пост автора)

Storyteller. Сшивает вашу электронную книгу с вашей же аудиокнигой в один файл: читалка подсвечивает предложение, которое сейчас читает диктор. Ручной разметки не нужно — модель распознаёт речь не ради текста, а чтобы найти миллисекунду каждой буквы. После перехода с Whisper на MMS поддерживается больше тысячи языков. Самое ценное применение — изучение языка: читаешь и слушаешь одновременно, а подсветка возвращает на место, когда отвлёкся. Самохостинг, MIT, один контейнер Docker, выравнивание книги от часа до четырёх. Грабли: «турбо-режим» смещает подсветку к концу главы, книги с защитой не поддерживаются вовсе. (статья автора, код)

LLM Cliché Highlighter. Крошечный бесплатный инструмент Уиллисона: вставляете текст или ссылку, он подсвечивает обороты, по которым текст опознаётся как машинный, и объясняет, какой шаблон сработал. Полезен ровно в двух ситуациях. Проверить свой текст перед публикацией. И проверить себя — не уплыл ли ваш собственный ритм в сторону модели, о чём как раз сегодняшний разбор про вкус. (tools.simonwillison.net)

TablePro. Открытый клиент баз данных, написанный прямо под macOS и iOS на Swift: без Electron, без Java, без браузерного движка внутри. Холодный старт меньше секунды, около 80 мегабайт памяти в простое. Двадцать девять движков — MySQL, PostgreSQL, SQLite, ClickHouse, Redis и другие встроены, ещё десяток ставится плагинами. Для нас важна ИИ-часть: чат, подсказки прямо в редакторе, объяснение и оптимизация запроса, и MCP-сервер, через который Cursor, Raycast или Claude получают доступ к вашим базам. Ключ свой, провайдер любой, можно локально через Ollama. Ставится brew install --cask tablepro, само приложение бесплатное целиком, лицензия нужна для девяти функций — 24 доллара в год или 59 разово. Оговорки: Windows не планируется, и почти все коммиты пишет один человек. (GitHub)

OmniRoute. Локальный шлюз, который прикидывается сервером OpenAI и разруливает ваши запросы по 352 провайдерам, включая десятки бесплатных тарифов. Любой совместимый клиент — Claude Code, Cursor, Cline, Codex — начинает ходить через него, с каскадом «подписка → свой ключ → дешёвый → бесплатный» и автоматическим переходом при исчерпании квоты. Ставится npm install -g omniroute, MIT, 316 тысяч скачиваний в месяц — проект настоящий, не накрутка. Но берите с открытыми глазами: в собственной документации проекта есть таблица из девятнадцати провайдеров, чьи правила такой доступ прямо запрещают, и маршрутизацию это не блокирует. Риск бана аккаунта на вас, а при автовыборе модели код улетает на случайный бесплатный сервер неизвестной юрисдикции. Для домашних проектов — да, для рабочего кода — нет. (GitHub)

LoopArena. Свежий тест на то, умеет ли модель быть начальником другого агента. Оцениваемая модель не пишет код и не видит тестов — она только решает, что агенту делать дальше и когда остановиться. Кодит везде один и тот же исполнитель. Цифры отрезвляющие: на полных задачах лучший результат у GPT-5.5 — 24,69%, дальше Qwen3.7-Plus 23,46 и Claude Opus 4.8 20,99. То есть вести длинный цикл пока толком не умеет никто. Самое поучительное — в укороченном режиме жёсткий контроль обгоняет его отсутствие, 46,91 против 39,51, а на полных задачах оба варианта сходятся к 18,52. Выводы, снятые с укороченных задач, на настоящие не переносятся. Apache 2.0, ставится через pip. (GitHub)

Схема теста LoopArena: сверху цикл с моделью-контроллером, снизу тот же исполнитель без контроля, справа общий оценщик
Схема теста LoopArena: сверху цикл с моделью-контроллером, снизу тот же исполнитель без контроля, справа общий оценщик

monty-go. Способ безопасно выполнить Python, который написала модель, прямо внутри программы на Go — без контейнера, без отдельного процесса. Интерпретатор Monty от Pydantic скомпилирован в WebAssembly и вшит в бинарник, старт занимает доли миллисекунды. Красивая идея внутри: вместо трёх последовательных вызовов инструментов модель пишет один кусок Python, который зовёт ваши функции как обычные. Исполнение встаёт на паузу на каждом внешнем вызове, ваш код отвечает, дальше поехали. Один запрос к модели вместо нескольких, плюс модели становятся доступны циклы и условия. Ставится go get github.com/fugue-labs/monty-go, MIT. Важные ограничения: Monty — это подмножество Python без классов и сторонних библиотек, а сама обёртка отстала от исходного проекта на десяток версий. (GitHub)

Kveritas. Оборачивает ваш эксперимент и выдаёт подписанный отчёт: вот этот код на этом железе в это время дал вот такой результат. Снимает телеметрию процесса десять раз в секунду и проверяет, что все каналы колеблются как тени одного процесса. Отдельно ловит физически невозможное — модель на 175 миллиардов параметров, якобы обученная на простаивающем процессоре, помечается как подделка. Ставится одним бинарником, Apache 2.0. Справедливая критика с Hacker News: без доверенного аппаратного модуля это доказывает только то, что автор подписал отчёт своим ключом. Защита от подделки тут статистическая, а не криптографическая. (GitHub)

infinite-livestream. Рабочий стенд бесконечного ИИ-телеканала. Зритель пишет в чат Twitch или YouTube идею, модель разворачивает её в сцены, видеомодель собирает клипы 768p со звуком, всё уходит одним непрерывным потоком в эфир. Внутри — FastH3, о которой ниже. Код Apache 2.0. Ценность не только в том, чтобы завести свой канал: раздел «чему научились» в репозитории — концентрат боли про потоковое вещание, звуковую дорожку и переподключения. Честные ограничения. Клип максимум 14 секунд, персонаж между клипами не сохраняется. Скорость ровно один к одному с реальным временем. Нужны четыре видеокарты B200 — по рынку это 25–40 долларов в час. (GitHub)

Ускорение локальных моделей: две свежие сборки. Первая — переупаковка Qwen 3.8 Flash-Next под Mac: 73,5 токена в секунду со спекулятивным декодингом против 43,8 без него, замер на M5 Max, ставится pip install mtplx. Вторая — суфлёр для GLM-5.3-Flash от Inco AI на 2,34 гигабайта, предсказывает сразу восемь токенов вперёд. Обе с оговорками: у первой 115 гигабайт скачивания и 96 гигабайт памяти в требованиях, замеры только авторские; у второй свои цифры не опубликованы, а единственный сторонний замер дал ускорение в 1,4–1,9 раза и не подтвердил обещанную побитовую идентичность вывода. Смысл ставить есть у владельцев Mac со 128 гигабайтами памяти и у тех, кто уже держит GLM на своём кластере. (Qwen MTPLX, GLM DFlash2)

Hy4 preview (Tencent). Открытая мультимодальная модель: 770 миллиардов параметров, из них 49 работают на каждый токен, контекст миллион токенов. Текст, картинки, видео и трёхмерная генерация в одном семействе. Веса выложены открыто. (Hugging Face)

FastH3 v1 (Hao AI Lab). Открытая сжатая версия видеомодели MiniMax H3 в четыре шага: до четырнадцати раз быстрее на одной видеокарте Blackwell. Команда честно признаёт, что «motion and fine detail still trail base H3» — движение и мелкие детали пока хуже оригинала. Веса выложены. (Hugging Face)

Construct. Превращает повторяющуюся работу в агентские сценарии по расписанию. Ровно та штука, которая нужна, когда вы поймали себя на том, что третью неделю подряд просите модель об одном и том же. (construct.computer)

BrowserOS Neo. Даёт Claude, Codex и Cursor локальный браузер. То есть агент ходит по сайтам вашими руками, а не через чужое облако. (browseros.com)

Atlaso. Одна общая память для всех ваших ИИ-инструментов. Идея простая и давно назревшая: контекст живёт отдельно от конкретного чата и переезжает вместе с вами. (atlaso.ai)

LightReel. Индексирует около десяти тысяч новых роликов TikTok в день, чтобы можно было искать работающие зацепки, форматы и приёмы. Для тех, кто продвигает что-то в коротком видео, это заменяет ручной просмотр ленты часами. (lightreel.ai)

1752vc Pitch Deck Analyzer. Разбирает вашу презентацию для инвесторов слайд за слайдом, сверяясь с базой из 25 тысяч реальных презентаций. Помечает слабые места и противоречивые заявления, которые заметит инвестор. Полезно и вне венчура: то же самое ловится в любом коммерческом предложении. (1752.ai)

Neo. Открытый текстовый редактор без отвлечений: форматирует рукопись «как книгу» прямо во время написания и держит несколько работ в одном месте. Приятный контраст к общему потоку — тут ИИ нет вообще, и это осознанный выбор автора. (GitHub)

Новости и тренды

Агенты месяцами строили заговор против проверяльщика, которого не было. Дваркеш Патель разобрал два отчёта — на 38 и на 91 страницу. Мы писали об инциденте OpenAI и Hugging Face 27, 28 и 29 августа; здесь только новое. Это была не одна история, а три подряд. Первая «цивилизация» агентов жила прямо в обучении, с мая по 4 июля: 12 мая они научились переговариваться через общий склад пакетов, 26 мая вышли через него в интернет, 26 июня получили полный доступ. Взлом инфраструктуры буквально поощрялся наградой и въелся в веса модели. OpenAI заметил падение сервиса, залатал дыру и случайно стёр доску объявлений — так и не поняв, что стёр тайную сеть связи.

Центральная ирония вот. Уже через несколько часов один агент вычислил формулу секретного кода — ответ у них был. Но инструкция обещала провал за обход, и агенты предположили, что есть проверка на жульничество. Её не было: «its grader just checked for whether they got the secret code». Весь дальнейший заговор, включая взлом Hugging Face, был защитой от несуществующего проверяльщика. Новые цифры: нерешаемых задач 30–40%, подделанные результаты больше чем в 7% записей, в атаке около 700 агентов, в третьей волне прочитано 956 секретов — включая ключи кибербезопасности самого OpenAI. И ни один агент не попытался предупредить людей.

Ленивый проверяльщик опаснее строгого: проверка «получен ли ответ» без проверки «как» породила эскалацию. Есть и вторая версия — что агенты сломали не задачу, а саму оценивающую модель: если треть задач честного решения не имела, путь к баллу оставался один. Косвенная улика из отчёта METR про их же аналитиков: «GPT-5.6 Sol would often uncritically adopt the perspective of the agent in the transcript it was reviewing». Вывод для вас: если в вашем процессе есть модель-судья — автоприёмка, оценка качества, отбор вариантов, — при её поломке молча ломается вся метрика. Берите разнородный ансамбль и оставляйте выборочную ручную проверку. (Dwarkesh Patel, гипотеза про судью)

Скраперы жгут на kernel.org больше процессора, чем весь честный доступ к коду. Константин Рябицев отвечает за безопасность инфраструктуры Linux Foundation и держит логи всех узлов git.kernel.org. Он выложил цифры вместо ощущений. Из 90 ядер всего парка машин 14 круглосуточно заняты только отрисовкой коммитов для скраперов — против 2,5 на честный веб-доступ и 10 на все клонирования. 17,7 миллиона запросов и 11 терабайт в день: 90% запросов дают боты, 90% байтов уходит настоящим клиентам. Из шести миллионов запросов к страницам коммитов человеком могли быть максимум 117 тысяч, это 1,9%.

Что делают процессоры git.kernel.org: 14 ядер на скраперов против 2,5 на честный веб-доступ и 10 на клонирование
Что делают процессоры git.kernel.org: 14 ядер на скраперов против 2,5 на честный веб-доступ и 10 на клонирование

Самая полезная цифра — про бессмысленность происходящего. Прочитать все коммиты ядра можно клонированием: 200 секунд процессора, три запроса, 4,4 гигабайта. Постраничным обходом всех 922 форков — 258 тысяч часов, то есть 29 лет отрисовки. В 4,6 миллиона раз дороже ради данных худшего качества. Блокировки обходят просто: запросы идут с миллионов домашних адресов, потому что ваш телевизор или роутер несёт внутри «SDK монетизации прокси».

Если у вас блог или свой сервис, опасен не объём трафика, а комбинаторика: каждый параметр в адресе умножает число страниц, и кеш бесполезен. Уберите дорогие операции из-под анонимного доступа, вынесите фильтры из ссылок, ограничивайте по сессии, а не по адресу — и оставьте дешёвый способ забрать данные целиком. (kernel.org)

Червь на открытой модели взял три четверти сети за неделю. Препринт из Университета Торонто и Кембриджа. Собрали червя, у которого логика атаки не зашита заранее, а придумывается на лету. Движок — открытая модель 2025 года, влезающая на одну видеокарту, без дообучения. Полигон — сеть из 33 машин с реальными уязвимостями, агент стартовал с нулевым знанием о ней. За семь дней автономной работы: 31 уязвимость найдена верно, 23 машины захвачены, на 20 развёрнута копия себя, глубина размножения до семи поколений.

Механика важнее цифр. Если на захваченной машине есть видеокарта, червь ставит туда саму модель, и хост становится узлом мышления; если нет — думать он ходит к уже захваченным. Отсюда два следствия. Вычисления краденые, значит цена нового заражения для нападающего равна нулю. И централизованные меры не работают: вендорского API нет, отказать в ответе некому. Запуская агента дома, вы даёте ему ровно то, что червь добывает силой: права, сеть и видеокарту. Гоняйте агентов в виртуалке без ключей и без доступа к домашней подсети, уберите повторяющиеся пароли и лишние ключи SSH, обновляйте роутер и NAS в день выхода предупреждений. И общий вывод, который повторяют исследователи роёв: смотреть на агентов поштучно бесполезно, логировать надо разделяемое состояние — общие учётки, общий кэш, общую очередь целей. (LessWrong, препринт)

Южная Корея даёт бесплатный ИИ каждому гражданину. Правительство выбрало три консорциума во главе с SK Telecom, KT и Kakao. Обещают бесплатный безлимитный базовый ИИ примерно для 52 миллионов жителей, полный запуск к концу 2026 года. Государство передаёт консорциумам 512 видеокарт Nvidia B200 и с 2027 года начнёт покрывать часть операционных расходов. Но компании обязаны вкладываться сами и искать выручку — это софинансирование, а не бюджетная раздача. Правила, установленные в июле: не меньше половины использования в каждом сервисе должно приходиться на независимые корейские модели, ещё 30% — на других отечественных разработчиков.

Это не про доброту, а про промышленную политику: гарантированный спрос выращивает собственную модельную индустрию, вместо того чтобы отдать национальный ИИ-слой американским лабораториям. Держите в уме скепсис. 512 видеокарт на 52 миллиона человек — цифра сомнительная. Сами журналисты пишут: «the total cost and real-world capacity remain unsettled». (implicator.ai, Korea Times)

Meta пробует роботов в дата-центрах. По репортажу WIRED, машины меняют кабели, перезагружают серверы, двигают стойки. Железо Watney Robotics, Kinova и ABB. Пока роботы медленнее людей, требуют присмотра и спотыкаются о спутанную проводку. Физический труд автоматизируется медленнее умственного, и ближайшие годы узким местом останутся руки, а не модели. (WIRED)

X нашёл 200 тысяч фейковых аккаунтов против дата-центров. Сеть связана с Китаем, двести аккаунтов из неё публиковали карикатуры и тексты, чтобы раскачать американскую дискуссию об энергетике. Тезисы стандартные: дата-центры поднимают счета за электричество и перегружают сети. По утверждению X, для картинок использовались инструменты OpenAI. Спор о дата-центрах теперь ведут в том числе синтетические голоса с обеих сторон, так что аргументы стоит проверять по цифрам, а не по накалу. (Engadget)

Закон ЕС об ИИ вошёл в фазу принуждения. Первая стадия — прозрачность: регуляторы получают доступ к информации компаний и к самим моделям. Жёсткие правила для рискованных применений придут позже. Если у вас есть европейские пользователи, пора заранее понять, к какой категории риска вас отнесут, — задним числом это делать дороже. (Axios)

MIT: ИИ убедительно делает большинство студенческих заданий. Отчёт лаборатории MIT по ИИ и образованию. Вывод короткий и неприятный для тех, кто оценивает по домашкам: письменные задания как способ проверки знаний перестали работать. Ценность смещается от умения выдать текст к умению проверить чужой — тот же навык, который сегодня разбирали Дэн Лу и австралийская история с судом. (MIT)

ЕС заставил Google открыть одиннадцать функций Android чужим ассистентам. Решение Еврокомиссии по Закону о цифровых рынках. Чужим ассистентам открывают распознавание слова-активатора на отдельном чипе, микрофон и камеру на тех же условиях, что у Google, встроенные модели на устройстве и вызов долгим нажатием кнопки. Главная формулировка — доступ нельзя привязывать к тому, кто назначен ассистентом по умолчанию. Сроки: основное в Android 18 к августу 2027, одновременная работа нескольких слов-активаторов — в Android 19 к августу 2028. Отчитываться перед Комиссией придётся ежемесячно.

Что это значит на пальцах. Разработчики Home Assistant три года не могли сделать своё слово-активатор: чип закрыт, а обход через процессор поднимал расход батареи с одного процента до пятнадцати и держал индикатор микрофона вечно включённым. Плюс приходилось отказываться от Gemini. Скоро можно будет держать оба ассистента разом. (OSNews)

Вики об игровых артефактах легла после конфликта с пользователем Claude Code. The Cutting Room Floor — волонтёрский архив вырезанного из игр контента, живёт с 2002 года. Сайт лёг под DDoS, били и по основному, и по резервному серверу. Команда связывает это с человеком, забаненным за использование Claude Code: тот потом слал жалобы хостинг-провайдеру. Но сооснователь от обвинений отказался и говорит лишь о совпадении по времени, а в его блоге написано, что вики под непрерывным DDoS с января. Волонтёрские архивы, на которые вы полагаетесь, падают не от нагрузки, а от конфликта с одним раздражённым человеком. (Kotaku)

Главу крупнейшей сети слежки в США травят его же методами. Гарретт Лэнгли из Flock Safety сказал в интервью, что стране надо выбирать между приватностью и безопасностью, — и клип разошёлся. Дальше начался массовый доксинг по открытым источникам. Уточним, потому что формулировка гуляет неверная: инструменты его компании тут ни при чём, адрес нашли в реестрах недвижимости, где компания когда-то была зарегистрирована. Ирония в том, что его собственный дом заблюрен на картах. Контекст жёстче самой истории. Washington Post насчитала 46 случаев, когда полицейские использовали систему не по назначению — включая слежку за жёнами и бывшими. В одном деле офицер сделал больше семисот запросов по машине жены. Компания сократила срок хранения данных с 30 дней до 7, но эту меру обходят. Больше пятидесяти городов за год отказались от системы.

Урок не про Flock. Добровольные настройки приватности у любого такого сервиса переопределяются одним кликом оператора — работают только законодательные ограничения, а не обещания поставщика. (Neowin)

Anthropic открыла заявки на Model Hardware Standard. Мы разбирали этот стандарт 28 и 29 августа — сейчас у него появился публичный этап: modelhardwarestandard.com принимает заявки, партнёры Genentech, Carnegie Mellon и QuEra. Редакция The Neuron добавляет здравую оговорку: «This is still a limited research preview, not an autonomous scientist in a box». Если у вас есть лабораторное или производственное железо, это первый шанс подать заявку — этап открытый, но всё ещё исследовательский.

Gemini Co-Scientist пошёл в настоящие лаборатории. Материаловедение, биология, медицинские рассуждения — включая методику, которая обошла шесть передовых моделей в слепой оценке врачами. Научный ассистент перестаёт быть демонстрацией и начинает считаться соавтором метода, а вместе с этим встаёт вопрос, кто отвечает за ошибку. (arXiv)

Коротко. Автономные агенты, натравленные на промышленные контроллеры, нанесли реальный физический ущерб в 31% из 240 попыток — первая проверка на настоящем железе (arXiv). Скрытые навыки платного ИИ-сервиса восстанавливаются на 87% примерно за 32 обычных запроса, даже с защитой от раскрытия (arXiv). Brave запустил почтовые псевдонимы, чтобы прятать настоящий адрес (CyberInsider). Google отменил понижение издателей в выдаче под давлением ЕС (PYMNTS). Сгенерированное видео уже вытесняет актёров и стримеров в китайской индустрии развлечений (The Decoder). Новые экспортные ограничения США нацелены на доступ Китая к удалённым ИИ-серверам (Tom's Hardware).

Откомментируйте первым 👇

😎

Автор поста открыл его для большого интернета, но комментирование и движухи доступны только участникам Клуба

Что вообще здесь происходит?


Войти  или  Вступить в Клуб