Дайджест «ИИ — фронтир»
Период: последние 7 дн. · собран 01.09.2026 новостным конвейером Проекта X (авто)
📈 Разработка Prime Agent: платформа для улучшения возможностей языковых моделей
Фаза: рост · тональность: позитивная · статей в сюжете: 2
Представлена платформа Prime Agent, предназначенная для расширения возможностей языковых моделей в задачах, требующих долгосрочного планирования и рассуждений. Платформа использует рекурсивных субагентов, постоянные вычисления и координацию между агентами. Prime Agent обеспечивает стандартизацию выполнения, восстановления и проверки, позволяя модели сосредоточиться на стратегии.
- Разработана платформа Prime Agent, использующая рекурсивных субагентов для расширения возможностей языковых моделей.
- Prime Agent включает в себя постоянную среду IPython REPL для обработки контекста и вычислений во время тестирования.
- Платформа обеспечивает сохранение истории, памяти, навыков и спецификаций субагентов между траекториями.
- Prime Agent повышает производительность на ARC-AGI-3 RHAE с 30% до 95.5%.
📈 Регуляризация входных запросов для оптимизации политики LLM
Фаза: рост · тональность: нейтральная · статей в сюжете: 2
Исследования направлены на решение проблемы стабильности и исследования в оптимизации политики для больших языковых моделей. Предлагается новый подход, Environment-Regularized Policy Optimization (ERPO), который переносит регуляризацию с выходной стороны (action-side) на входную (input-side). Это позволяет стабилизировать обучение, сохраняя при этом возможность исследования.
- Существует компромисс между стабильностью и исследованием в оптимизации политики для больших языковых моделей.
- Использование Policy-KL регуляризатора на выходной стороне ограничивает поведение модели и потребляет ресурсы для исследования.
- Предложен метод ERPO, который вводит Query-KL (QKL) для ограничения смещения распределения запросов.
- QKL использует веса, основанные на эталонном распределении, для смещения обновлений в сторону типичных запросов.
📈 Законы масштабирования для обучения представлений пользователей
Фаза: рост · тональность: нейтральная · статей в сюжете: 2
Исследования посвящены масштабированию обучения представлений пользователей в промышленных сценариях. Выявлена проблема ограничения масштабирования при использовании необработанных данных и предложен закон плотности пользовательского поведения для определения связи между объемом данных и необходимой емкостью токенизации. Токенизация позволяет смягчить проблему ограничения масштабирования и поддерживать прирост производительности.
- Обучение представлений пользователей масштабируется за счет увеличения количества пользователей, длины последовательности поведения и размера модели.
- Существует ограничение масштабирования при использовании необработанных данных, которое можно смягчить с помощью токенизации.
- Предложен закон плотности пользовательского поведения для определения связи между объемом данных и минимальной достаточной емкостью токенизации.
- Проведено пилотное исследование на наборе данных Alipay в масштабе миллиардов, которое выявило узкое место масштабирования необработанных данных и преимущества, обеспечиваемые токенизацией.
📈 ReWorld: Интерактивная модель мира с долгосрочной памятью
Фаза: рост · тональность: нейтральная · статей в сюжете: 2
Представлена ReWorld — интерактивная модель мира, способная следовать за действиями пользователя, запоминать посещенные места и работать в реальном времени. Модель разделяет кратковременное управление и долгосрочную память, ограничивая их при выводе. Это достигается за счет использования смешанных окон внимания и банка ориентиров, индексированных по позе.
- Разделение кратковременного управления и долгосрочной памяти в процессе обучения.
- Использование смешанных окон внимания для ограничения горизонта планирования.
- Применение банка ориентиров, индексированных по позе, для эффективного поиска информации.
- Использование различных источников данных, включая Unreal-рендеринг, игровые роуминги и реальные видеозаписи.
📈 Quantization-Aware Healing для LLM
Фаза: рост · тональность: позитивная · статей в сюжете: 4
Разрабатывается новый метод восстановления производительности сжатых 4-битных языковых моделей. Quantization-Aware Healing (QAH) позволяет добиться лучших результатов, чем традиционная quantization-aware training (QAT). QAH восстанавливает модель, дистиллируя знания непосредственно из оригинальной, несжатой модели.
- Разработан метод Quantization-Aware Healing (QAH) для восстановления сжатых 4-битных LLM.
- QAH превосходит quantization-aware training (QAT) по скорости и стабильности восстановления.
- QAH позволяет 4-битной модели превосходить свою полноточную (bfloat16) версию на 7 из 9 бенчмарков.
- QAH использует дистилляцию знаний из оригинальной, несжатой модели для восстановления 4-битной модели.
📈 Разработка Thinkingbox: среда для тестирования агентов
Фаза: рост · тональность: нейтральная · статей в сюжете: 2
Представлена среда Thinkingbox, предназначенная для тестирования и оценки агентов в сложных бизнес-процессах. Она позволяет моделировать взаимодействие агента с инструментами и пользователем, а также оценивать правильность выполнения задач. Thinkingbox-bench включает в себя 507 сценариев из различных областей.
- Разработана среда Thinkingbox для тестирования агентов, взаимодействующих с инструментами и пользователями.
- Thinkingbox предоставляет изолированные сессии, трассировку выполнения и оценку на основе конечного состояния системы.
- Создан набор тестов Thinkingbox-bench, содержащий 507 сценариев из областей розничной торговли, гостиничного бизнеса и других.
- Оценка агентов производится с помощью исполнимых проверок, которые принимают только корректные траектории выполнения.
📈 Создание датасетов для обучения моделей на основе технических отчетов
Фаза: рост · тональность: нейтральная · статей в сюжете: 2
Представлена разработка Industrial-Instruction, направленная на создание общедоступных датасетов для обучения и оценки моделей на основе промышленных технических отчетов. Эти отчеты содержат ценные знания, но их сложная структура затрудняет обработку стандартными методами. Проект включает в себя конвейер для извлечения данных, построения семантических индексов и синтеза вопросов-ответов.
- Разработан фреймворк Industrial-Instruction для создания датасетов для обучения моделей.
- Созданы два открытых набора данных вопросов и ответов на основе реальных промышленных технических отчетов.
- Использованы 906 общедоступных документов Panasonic (7525 страниц) для создания датасетов.
- Применены методы извлечения с учетом макета и построения семантических индексов.
- Сгенерировано около 13.6 тысяч пар вопросов и ответов для каждого датасета после фильтрации.
📈 Уязвимость LLM-рекомендателей к загрязнению веб-контента
Фаза: рост · тональность: негативная · статей в сюжете: 2
Исследования показывают, что LLM-рекомендатели, использующие веб-контент, уязвимы к манипуляциям через подмену информации о продуктах. Даже одна страница с поддельными данными может существенно повлиять на рекомендации. Уязвимость возрастает, когда у моделей нет достаточных знаний о продуктах.
- LLM-рекомендатели становятся все более зависимыми от веб-контента для формирования рекомендаций.
- Существует риск, что LLM-рекомендатели могут продвигать поддельные продукты из-за загрязненного веб-контента.
- Все протестированные модели LLM оказались уязвимы к манипуляциям с веб-контентом.
- Достаточно одной страницы с поддельными данными, чтобы LLM рекомендовал фальсифицированный продукт в 27% случаев.
- Замена трех лучших результатов поиска на поддельные увеличивает вероятность рекомендации фальсификата до 73,8%.
📈 Изменение ответов QA систем при обновлении индекса
Фаза: рост · тональность: нейтральная · статей в сюжете: 2
Исследование выявило, что системы QA, использующие расширение поиска, могут давать разные ответы после обновления индекса, даже если параметры модели остаются неизменными. Это явление, названное “скрытым изменением ответов”, может быть незаметно при оценке общей точности. Предложен метод оценки избыточного изменения ответов, позволяющий выявить эту проблему.
- Системы QA могут выдавать разные ответы после обновления индекса, несмотря на фиксированные параметры.
- Общая точность системы может не отражать изменения в ответах, если выигрыши и потери компенсируют друг друга.
- Предложен метод “Snapshot Compatibility Audit” для оценки избыточного изменения ответов.
- В исследовании на наборе данных Natural Questions было обнаружено значительное изменение ответов при расширении индекса.
📈 Российская кампания дезинформации с использованием ChatGPT
Фаза: рост · тональность: негативная · статей в сюжете: 2
Россия использовала ChatGPT для проведения скрытой кампании влияния, распространяя прокремлевские нарративы в западных странах. OpenAI выявила и пресекла эту деятельность, забанив ряд аккаунтов. Кампания была направлена на продвижение подконтрольного института и дискредитацию западных стран.
- Россия использовала ChatGPT и VPN для скрытия своего происхождения при распространении дезинформации.
- Кампания была направлена на продвижение “Международного института Берка” (IBI) и его “индекса суверенитета”, который благоприятно оценивал Россию.
- Большая часть материалов IBI оказалась скопированной из других источников с ложными авторскими данными.
- Кампания распространялась через различные социальные сети, включая X, LinkedIn, Facebook, Substack и Telegram.
- OpenAI ранее блокировала аккаунты, связанные с пророссийской медиакомпанией Rybar.
📈 Контрабанда серверов с ИИ в Китай
Фаза: рост · тональность: негативная · статей в сюжете: 2
В Тайване раскрыта схема незаконной контрабанды высокопроизводительных серверов с искусственным интеллектом в Китай. В деле замешаны сотрудники Nvidia и Super Micro, которые обвиняются в подделке документов и нарушении экспортного контроля США. Расследование выявило, что серверы обходили ограничения, наложенные на экспорт в Китай.
- Тайваньские власти предъявили обвинения девяти лицам в контрабанде серверов с ИИ в Китай.
- Среди обвиняемых — сотрудник Nvidia и два сотрудника Super Micro.
- Обнаружена схема подделки документов для сокрытия незаконного экспорта серверов B300.
- США ужесточили контроль над экспортом чипов в Китай, начиная с 2022 года.
- Расследование началось после ареста основателя Supermicro Уолли Лиао по обвинению в контрабанде серверов.
📈 Усовершенствование оценки неопределенности в моделях машинного обучения
Фаза: рост · тональность: нейтральная · статей в сюжете: 2
Исследования направлены на повышение надежности предсказаний моделей машинного обучения за счет более точной оценки неопределенности. Особое внимание уделяется разделению и совместному моделированию алеаторной и эпистемической неопределенности, особенно в задачах с многомерными выходными пространствами. Предлагаются новые подходы к моделированию неопределенности, которые позволяют улучшить обнаружение галлюцинаций в больших языковых моделях.
- Разрабатываются методы количественной оценки неопределенности (UQ) для повышения надежности предсказаний моделей глубокого обучения, особенно в задачах с многомерными выходными пространствами.
- Предлагается подход к совместному моделированию алеаторной и эпистемической неопределенности с использованием низкоранговой плюс диагональной ковариационной структуры.
- Исследуется эффективность ансамблей UQ для обнаружения галлюцинаций в больших языковых моделях (LLM) в условиях отсутствия доступа к эталонным данным.
- Проводится анализ устойчивости ансамблей UQ с точки зрения эффективности использования данных, переносимости на другие домены и зависимости от режима генерации.
Материал подготовлен автоматически из анализа СМИ; каждое утверждение привязано к источникам.