Лента

52 материалов

Сортировка
Новости29 сентября 2026

От выпуска к внедрению: что сдерживает рынок человекоподобных роботов в Китае

Китайские производители наращивают выпуск человекоподобных роботов и опираются на существующие цепочки поставок, чтобы уменьшить себестоимость. В статье разбирается, почему более низкая цена ещё не гарантирует массового спроса: решающими остаются надёжность, повторные заказы, окупаемость и способность бизнеса сохранять прибыльность.

От выпуска к внедрению: что сдерживает рынок человекоподобных роботов в Китае
Читать
Новости29 сентября 2026

Симуляция для проверки причинных выводов о сбоях в рекламе

В TRACE скрытые вмешательства в симуляторе цифровой рекламы дают возможность автоматически оценивать, верно ли агент выявил источник сбоя и затронутый сегмент, хотя для этого ему приходится анализировать зашумлённые данные с помощью Python и SQL. После обучения с подкреплением на синтезированных сигналах модель Qwen3.5-35B-A3B получила 0,757 по FullAttr@1 на 235 тестовых эпизодах — выше всех проверенных вариантов с подсказками и при меньшем числе вызовов инструментов, чем у базовой модели.

Симуляция для проверки причинных выводов о сбоях в рекламе
Читать
Новости27 сентября 2026

Проверка действий ИИ-агента: от правдоподобного ответа к соблюдению процедуры

В статье описана система, которая определяет, какие процедурные требования относятся к запросу, и проверяет их по ответу или журналу выполнения. На тестах она выявляла структурные сбои, незаметные при оценке одного лишь результата; автоматическое извлечение требований сохраняло часть этой диагностической точности, но зависело от настройки модели.

Проверка действий ИИ-агента: от правдоподобного ответа к соблюдению процедуры
Читать
Новости26 сентября 2026

Архитектура поддержки на миллионах диалогов: разделение поиска, действий и генерации

На примере сервиса бронирования жилья авторы разбирают переход от единой модели к ограниченному оркестратору типизированных операций и генератору, опирающемуся на проверенный контекст; эффекты архитектуры оцениваются отдельно от сопутствующих изменений. В повторно воспроизведённых диалогах выросла точность выбора брони, исчезли ошибки в структурированных действиях и сократились эскалации; оптимизация также уменьшила задержку и затраты на обслуживание модели, тогда как объём передачи диалогов операторам в продакшене существенно не изменился.

Архитектура поддержки на миллионах диалогов: разделение поиска, действий и генерации
Читать
Новости21 сентября 2026

Британский энергорегулятор ищет способ отсеять мнимые проекты ЦОД из переполненного списка на присоединение

Ofgem предлагает обязать застройщиков центров обработки данных вносить невозвратные платежи и подтверждать финансирование до получения доступа к сети. Цель — ускорить обслуживание реальных проектов, не отпугнув при этом инвестиции, от которых зависит развитие ИИ в стране.

Британский энергорегулятор ищет способ отсеять мнимые проекты ЦОД из переполненного списка на присоединение
Читать
Новости21 сентября 2026

QueryStory раскрывает продукт и $6 млн посевных: ИИ-аналитика данных с опорой на проверяемость выводов

Стартап выходцев из Google и Chronicle предлагает крупным компаниям платформу, где LLM-анализ сопровождается показом SQL-запросов, оценкой уверенности и фиксацией человеческих проверок. Читатель получит представление о том, как вендор пытается снять недоверие к ответам моделей в регламентированных отраслях и чем такой подход отличается от универсальных чат-инструментов.

QueryStory раскрывает продукт и $6 млн посевных: ИИ-аналитика данных с опорой на проверяемость выводов
Читать
Новости19 сентября 2026

Байесовский взгляд на RAG: как разложить ошибки конвейера по полочкам

Новый подход предлагает описывать работу RAG-системы не одной итоговой метрикой, а совместной вероятностной моделью, где отдельно учитываются удача поиска, уместное воздержание и правильность ответа — в том порядке, в каком информация проходит по пайплайну. Проверка на 27 конфигурациях показала: системы, неразличимые по сводным показателям, на деле ведут себя по-разному, а дешёвые оценки LLM-судьи можно подключить к модели как шумные наблюдения и объединить с небольшим числом человеческих разметок.

Байесовский взгляд на RAG: как разложить ошибки конвейера по полочкам
Читать
Новости17 сентября 2026

Где LLM-судья ошибается: проверка надежности автоматической оценки голосовых агентов

Авторы препринта arXiv сравнили, как люди-оценщики и модели GPT-4.1 и GPT-5 судят одни и те же разговоры голосовых агентов в телекоме и ритейле — по 10 метрикам эффективности и безопасности в трех схемах оценки. Вывод: автоматика годится не везде, а часть показателей (например, Recovery Turn Count и safety-recall) пока нельзя отдавать машине без присмотра человека.

Где LLM-судья ошибается: проверка надежности автоматической оценки голосовых агентов
Читать
Новости17 сентября 2026

Плата за передачу управления: почему смена модели посреди задачи съедает выгоду

Исследование о том, что происходит, когда длинную задачу кодинг-агента подхватывает другая модель: полная преемственность контекста при переходе на более сильную модель редко окупается и даёт лишь часть прироста качества. А вот обратный манёвр — уход на дешёвую модель после тяжёлых рассуждений — выглядит выгодным по соотношению цены и результата.

Плата за передачу управления: почему смена модели посреди задачи съедает выгоду
Читать