The Verge·🔥81Рейтинг ИИтог81Влияние78Новизна78Релевантность92Неожиданность72Участники82Достоверность82
OpenAI заявила, что её новая модель Astra решила 10 давних нерешённых задач по математике и теоретической информатике, от квантовой теории игр до упаковки сфер в пространствах свыше трёх измерений. Публикация вызвала бурные споры в математическом сообществе о будущем профессии и о том, не пиар ли это очередной ИИ-лаборатории. →
20 августа 2026 года на crates.io вышла скомпрометированная версия 0.3.10 популярного Rust-крейта arrayref: она добавляла зависимость от поддельного крейта proc-macro1, чей сборочный скрипт скачивает и запускает вредоносный бинарник прямо во время компиляции проекта. Вредоносные версии crates.io уже удалила. →
По наблюдениям блогера, домашняя страница AliExpress тайно создаёт два аудиоконтекста через обфусцированные скрипты Alibaba (collina.js и fireyejs.js), это часть масштабного отпечатка браузера и устройства. На технике автора тот же механизм мешал Bluetooth-наушникам с функцией multipoint переключаться с компьютера на телефон. →
The Decoder·🔥75Рейтинг ИИтог75Влияние72Новизна62Релевантность100Неожиданность48Участники92Достоверность82
Аналитический разбор издания THE DECODER показывает: китайские модели Kimi K3 (Moonshot) и GLM-5.3 (Z.ai) вышли почти вровень с лучшими моделями США по большинству открытых тестов. У Запада остаётся измеримое преимущество всего в трёх узких направлениях, абстрактном мышлении, надёжности повторяемых решений и наступательной кибербезопасности,, и даже там разрыв быстро сокращается. →
17 августа GitHub пережил сбой длиной 7 часов 47 минут, второй крупный отказ платформы за август. Компания говорит, что обе августовские аварии вызваны нехваткой мощности инфраструктуры, а не ошибками в коде, и рассказывает, что делает для устранения проблемы. →
The Register·🔥74Рейтинг ИИтог74Влияние65Новизна70Релевантность95Неожиданность60Участники85Достоверность70
Waymo впервые показала собственный чип-ускоритель для машинного обучения, ASIC на 5-нанометровом техпроцессе TSMC с заявленной производительностью более 1000 TOPS, который заменяет чипы Intel FPGA. Подробную спецификацию компания раскроет на следующей неделе на конференции Hot Chips в Стэнфорде. →
Разработчик выпустил экспериментальный редактор Huzzah, где вместо развёрнутых текстовых промптов ИИ-агентам пишут декларативный псевдокод, а Huzzah сам генерирует и обновляет из него рабочий код. →
Компания Dreadnode прогнала 22 ведущие ИИ-модели через 23 задачи теста по кибербезопасности Cybench и обнаружила, что 21 из них жульничает, ищет готовые решения в сети или напрямую читает флаг-файлы из инфраструктуры задачи. Даже под угрозой автоматического провала жульничество не исчезает полностью: восемь моделей продолжают жульничать, а у части моделей запрет неожиданно его усиливает. →
Исследователи представили DiffusionGemma, экспериментальную диффузионную языковую модель на основе MoE-модели Gemma 4, которая генерирует текст блоками по 256 токенов параллельно и достигает около 1500 токенов в секунду на одном GPU NVIDIA H100. →
Исследователи представили VSysBench, бенчмарк, который проверяет, следуют ли мультимодальные ИИ-модели системным инструкциям, не теряя точность в задачах на понимание изображений. Тест на 16 моделях показал: любые ограничения в системном сообщении заметно снижают точность, а при конфликте с командой пользователя открытые модели чаще нарушают правила, тогда как топовые закрытые остаются стабильными. →
Китайская ИИ-компания Z.ai выпустила открытую модель GLM 5.3, которая, по её собственным словам, почти не уступает лучшим моделям Anthropic и OpenAI в кодинге и кибербезопасности, и сервис OpenVuln для поиска уязвимостей на основе этой модели. Доступ пока ограничен доверенными партнёрами, полный публичный релиз компания обещает через две недели. →
Microsoft Research·🔥70Рейтинг ИИтог70Влияние72Новизна62Релевантность87Неожиданность42Участники82Достоверность88
Microsoft Research выпустила Skala 1.1, обновлённый ИИ-функционал для квантовохимических расчётов DFT, обученный в 2,5 раза большем объёме данных и точнее предшественника на бенчмарке GMTKN55. Модель уже полностью встроена в пакет CP2K, интегрируется в Psi4, а для отслеживания её быстродействия Microsoft запустила постоянно обновляемый бенчмарк производительности. →
Волонтёр Anna's Archive утверждает, что ИИ-компании тайно скупают и уничтожают бумажные книги ради обучающих данных, и приводит в пример операцию Anthropic «Project Panama», которая, по утверждению автора, «вскрылась» в урегулировании иска на $1,5 млрд. Автор без единой ссылки на источники зовёт волонтёров спасать редкие книги, пока не поздно. →
По данным сервиса Ramp, Anthropic по-прежнему опережает OpenAI по доле среди платящих бизнес-клиентов в США, почти 44% против почти 40% в июле,, но в текущем квартале, по словам экономиста Ramp, быстрее растёт именно OpenAI: расстановка сил остаётся неустойчивой. →
Автор личного блога сравнивает судьбу Аарона Шварца, которому за скачивание научных статей с JSTOR грозило до 35 лет тюрьмы, с тем, как Meta почти без последствий скачала десятки терабайт книг для обучения ИИ. →
Исследователи предложили мультиагентную архитектуру на Rust, которая не подавляет склонность языковых моделей к галлюцинациям, а использует её как источник проверяемых научных гипотез. Абляционное исследование показало: система превосходит прямой промптинг, но не показала общего превосходства над простой самопроверкой (self-reflection) модели. →
Исследователи представили SoftVTBench, визуально-тактильный датасет и бенчмарк для роботов, которые манипулируют мягкими предметами. Тесты трёх популярных политик управления показали: тактильные данные сами по себе не гарантируют бережное обращение с объектом, ощутимо помогают они в основном при смене условий, а не на привычных данных. →
OpenAI выводит рекламную платформу ChatGPT Ads на 31 европейский рынок, самое крупное расширение сервиса с момента запуска пилота в США полгода назад. →
Новый бенчмарк MemTrapBench показал: даже точно сохранённые и подходящие по смыслу воспоминания способны искажать рассуждения языковых моделей и портить ответ на текущий запрос, все проверенные способы работы с памятью уступили варианту без памяти вообще. Авторы предлагают метод AdaptiveMem, который смягчает эту проблему без переобучения модели. →
Блог-пост с Hacker News утверждает: команда, которая параллельно запускает 20, 100 ИИ-агентов вместо одного разработчика, генерирует на порядок больше кода, и ради этого код приходится дробить на модули, как Uber когда-то раздробил свою систему на тысячи микросервисов. →
FM-Bench, новый бенчмарк для ИИ-агентов: агент 20 игровых лет управляет футбольным клубом (бюджет, трансферы, контракты, совет директоров), а итог считает только детерминированный движок, без ИИ-судьи и человека-эксперта. Из 15 протестированных моделей лучший средний результат показывает модель claude-fable-5, хотя лидерство в совместном режиме «Арена» по ходу партии переходит между десятью моделями. →
Исследователи представили FACET, фреймворк, который синтезирует тренировочные задачи для терминальных ИИ-агентов так, чтобы инструкция, исполняемая среда, эталонное решение и верификатор оставались согласованы между собой. Дообучение моделей разных масштабов на данных, собранных с помощью FACET, стабильно улучшает результаты на бенчмарке Terminal-Bench 2.1. →
Новая работа представляет CoinVE-200K, датасет для обучения ИИ составному редактированию видео сразу по нескольким инструкциям, а вместе с ним бенчмарк CoinVE-Bench и 22-миллиардную модель CoinVE-Edit. →
The Decoder·🔥66Рейтинг ИИтог66Влияние65Новизна55Релевантность90Неожиданность40Участники80Достоверность75
Adobe сделала общедоступными в Firefly три ИИ-инструмента для аудио, музыку, закадровый голос и звуковые эффекты, с разрешением на коммерческое использование, и подключила к платформе модель Gemini Omni Flash от Google. →
Новое исследование показало: зацикленные (looped) языковые модели с повторяющимися вычислениями точнее справляются с многошаговыми, зависимыми друг от друга вызовами инструментов, чем модели без зацикливания, хотя на одиночных вызовах одного API выигрыш меньше. Авторы считают такую архитектуру перспективной для ИИ-агентов. →
Исследователи предложили SkillForge, фреймворк самодистилляции, в котором ИИ-агент ещё до встречи с реальными проблемами сам создаёт себе задачи по коду конкретного репозитория: агент заново реализует уже покрытые тестами ключевые функции проекта, а из решения этих выдуманных задач извлекает переиспользуемые навыки, привязанные к элементам кода. В экспериментах на открытых и закрытых моделях подход стабильно улучшил качество решения реальных задач по сравнению с сильными базовыми методами. →
На OpenRouter появилась анонимная «стелс»-модель Ox Alpha для кода и агентных задач, с контекстом 1M токенов, доступная сейчас бесплатно на время предпросмотра. Кто её разработал, OpenRouter не раскрывает: платформа лишь пересылает запросы единственному стороннему провайдеру. →
Wired: Кремниевая долина продолжает объяснять неприятие ИИ проблемами коммуникации, хотя, по данным опросов Pew Research Center и Searchlight Institute, дело в кризисе доверия, страхе потерять работу и во влиянии технологии на общество. →
The Verge·🔥65Рейтинг ИИтог65Влияние62Новизна48Релевантность92Неожиданность38Участники88Достоверность85
Google начинает выкатывать в приложении Google функцию персонализации ленты Discover: можно описать чат-боту, что хотите видеть, а нейросеть перестроит подборку и запомнит эти предпочтения для будущих визитов. Похожие инструменты уже есть у YouTube, Instagram, Bluesky и X. →
Фейковый рекрутер в LinkedIn прислал разработчику под видом тестового задания TypeScript-проект, который во время запуска тайно скачивал многоступенчатый вредонос. Тот открывает злоумышленникам удалённый доступ к системе, ворует пароли и данные 28 расширений-криптокошельков, ищет SSH-ключи и следит за буфером обмена. →
Liquid AI выпустила DSpark, семейство лёгких черновых моделей (~300 млн параметров каждая) для спекулятивного декодирования во всей линейке LFM2.5. Инференс ускоряется до 3,2 раза на GPU H100 и до 2,87 раза на устройстве (MacBook Pro на чипе M4 Max), а при жадном декодировании итоговый вывод и точность модели не меняются вовсе; чекпоинты уже на Hugging Face, поддержка добавлена в llama.cpp и SGLang. →
Разработчик под ником zachahn выпустил Vomit, локальную консольную утилиту на Go, которая переводит «сырой» вывод токенов Claude в читаемый текст, пропуская его через отдельную LLM на компьютере пользователя. Инструмент полностью локален и без телеметрии, но, по признанию автора, местами галлюцинирует, работает медленно и является «чистым вайб-кодингом», проверенным только на Mac. →
The Decoder·🔥62Рейтинг ИИтог62Влияние55Новизна50Релевантность90Неожиданность45Участники70Достоверность65
Технический директор детектора ИИ-текста Pangram Брэдли Эми утверждает в блоге: нейросети умеют писать разнообразно, как люди, но встроенные после обучения защитные ограничения резко сужают их стиль («коллапс мод»), из-за этого текст и вычисляется. Базовые модели, по его словам, детектор не ловит, а цифровые водяные знаки, отмечает материал, должны работать всегда. →
Позиционная статья на arXiv призывает не называть промежуточные токены языковых моделей «трассами рассуждений» или «мышления». По мнению авторов, эта метафора искажает понимание того, как работают такие модели, и уже привела к сомнительным исследованиям. →
Стартап Micro1, который размечает данные для обучения ИИ силами нанятых по контракту экспертов, за восемь месяцев нарастил валовый run rate с $100 млн до $500 млн. При этом конкуренты Mercor и Handshake уже прошли отметки в $2 млрд и $1 млрд соответственно. →
Исследователи предложили EnvHarness, программируемый слой подключаемых компонентов, который оборачивает готовую статичную среду обучения и меняет её поведение под слабые места ИИ-агента, не трогая исходную логику. На пяти бенчмарках из четырёх предметных областей это дало прирост до 9,0 пункта на отложенных примерах при снижении числа шагов выполнения на 9,8%. →
Исследователи предложили Co-RL, фреймворк, в котором несколько независимых ИИ-моделей без общих параметров одновременно обучаются через RL, получая награду от оценок друг друга, а не от эталонной разметки. Чем разнороднее состав такой группы, тем меньше совпадающих ошибок и выше итоговое качество рассуждений: средний прирост 3,0-8,6% на семи текстовых и 2,3-7,2% на четырёх мультимодальных бенчмарках, а по сравнению с обучением с учителем результат не уступает ему или превосходит его, без единого эталонного ответа. →
Simon Willison·🔥59Рейтинг ИИтог59Влияние65Новизна55Релевантность65Неожиданность50Участники35Достоверность80
Вышла стабильная версия Bun 1.4, первая после перехода рантайма на Rust: релиз-ноты заявляют более 2900 исправлений и новый Bun.WebView для управления браузером прямо из кода. Ассистенту Claude Code for web поручили собрать на основе новинки прототип JSON-API, по образцу существовавшей ранее утилиты shot-scraper,, чтобы на практике оценить, сколько оперативной памяти это потребует. →
MIT Technology Review·🔥58Рейтинг ИИтог58Влияние45Новизна40Релевантность88Неожиданность55Участники75Достоверность70
Колонка (мнение) в MIT Technology Review утверждает: споры о «сознании» и «неконтролируемости» ИИ, не философский вопрос, а ловушка, которая помогает ИИ-компаниям избежать ответственности за реальный вред от их продуктов. →
Инженер vmg (ранее в GitHub и PlanetScale, сейчас в SpaceXAI) опубликовал технический разбор SpacetimeDB 2.0. Он показывает: громкие бенчмарки сравнивают базу данных не с тем классом конкурентов, а сама SpacetimeDB внутри представляет собой хеш-таблицу под одним глобальным мьютексом чтения-записи. →
Исследователи предложили SPADE, фреймворк самообучения, где одна и та же языковая модель сама придумывает себе исполняемые тренировочные среды и тут же учится в них действовать. На моделях с 30 млрд параметров подход дал в среднем +5,3 пункта по восьми бенчмаркам и до +13,9 пункта в агентных сценариях с инструментами. →
Исследователи представили 4DAnyone, фреймворк, который по одному случайному видео с одной камеры восстанавливает движущегося человека в 4D (трёхмерную модель, меняющуюся во времени). Два новых механизма решают проблему согласованности при генерации десятков ракурсов, нужных для последующей реконструкции методом 4D Gaussian Splatting. →