Тест-драйв подключения ИИ к 1С: Алиса AI для бизнеса, ChatGPT и Claude на двух живых базах

Мы дали трем нейросетям одни и те же вопросы к одним и тем же базам 1С и посчитали ответы в процентах. Две базы: бухгалтерская и торговая. Десять вопросов на каждую, от "сколько складов" до "какие товары лежат на остатке, но не продавались два года". Эталон снят заранее запросами к базе, оценка по совпадению с ним. Ниже сначала результаты и выводы, потом подробно о том, как считали, чтобы каждую цифру можно было проверить.

Алиса AI для бизнесаChatGPTClaude1Ссравнение

Часть 1. Результаты и выводы

Бухгалтерия предприятия 3.0, десять вопросов

НейросетьЧерез Жёлтый мостШтатно, без моста
ChatGPT, GPT-6 Astra (агент Codex)100%нет способа
Claude, Fable 5.1 (агент Claude Code)100%нет способа
Алиса AI для бизнеса92%, 15-30 с на все92%, около 60 с, нужна публикация базы

Управление торговлей 11, десять вопросов

НейросетьЧерез Жёлтый мостШтатно, без моста
ChatGPT, GPT-6 Astra (агент Codex)100% и 85% в двух прогонахнет способа
Claude, Fable 5.1 (агент Claude Code)100%, снимал эталоннет способа
Алиса AI для бизнеса100%, около минуты100%, 1-1,5 минуты, нужна публикация базы

Что это значит

Все три модели умеют читать 1С и почти не ошибаются в цифрах. Остатки, долги, обороты, сравнение периодов, топ товаров: на простых и средних вопросах ответы совпали с эталоном до копейки у всех. Различия начинаются на многошаговых вопросах, где надо соединить два условия или заглянуть туда, куда не просили.

Алиса стабильна, но не заглядывает дальше вопроса. На бухгалтерской базе она четыре раза подряд дала один и тот же ответ на вопрос о непроданных товарах, учитывая только оптовые реализации и не заметив розничных продаж. ChatGPT и Claude розницу проверили сами. На торговой базе, где бухгалтерских инструментов у плагина нет, Алиса пошла произвольными запросами и набрала 100%.

ChatGPT дотошнее всех и медленнее всех. На торговой базе он посчитал продажи по регистру выручки, а не по документам, и вскрыл, что две крупные реализации оформлены как "товары в пути" без признанной выручки. Он же заметил, что кабели учитываются в метрах, а вопрос был про штуки. Оба раза он был точнее эталона, и эталон пришлось дополнить. Цена: до полутора минут на вопрос. Во втором прогоне та же модель ответила за 23 секунды без единой ошибки запроса, но на вопросе с двумя условиями выполнила одно и потеряла 15%. Повторяемость на сложных вопросах не гарантирована ни у кого.

Мост не делает модель умнее. Это видно по Алисе: 92% через мост и 92% напрямую на бухгалтерии, 100% и 100% на торговле. Мост убирает другое: необходимость публиковать базу в интернет, ставить расширение и заводить служебного пользователя. И еще одно, что заметила сама Алиса: "ошибки были более информативные, конкретные сообщения вместо Неопределено, что ускорило поиск правильных имен полей". Штатное расширение Яндекса при ошибке запроса отдает модели пустое слово, мост отдает текст ошибки платформы.

Для ChatGPT и Claude без моста доступа к 1С нет вообще. У них нет штатного плагина к базе, поэтому колонка "без моста" у них пустая по определению, а не по результату теста.

Зачем в этой схеме мост

Жёлтый мост стоит между нейросетью и базой. В базу ставится внешняя обработка, она сама по исходящему соединению забирает задания и возвращает результат; наружу база не публикуется, порты не открываются. Нейросеть работает через адрес шлюза: ChatGPT и Claude как агенты по ключу, Алиса через свой штатный плагин, в который вписывается адрес ключа вместо адреса опубликованной базы. Одна и та же обработка обслуживает все три модели, поэтому сравнение получилось честным: база, состояние данных и путь к ним одинаковые.

Что мост дает сверх доступа. Обязательная маскировка персональных данных: в торговой базе менеджеры и часть партнеров оказались физлицами, их имена ушли в модели звездочками, и вопросы теста пришлось строить так, чтобы это не влияло на оценку. Журнал каждого обращения: число запросов и их время в этой статье взяты оттуда. Ключ только на чтение для Алисы и пробный прогон с откатом для записи у агентов.

Три оговорки, которые нужно знать

Алиса не пишет в 1С. Ни штатно, ни через мост. В описании плагина Яндекса прямо сказано: "запись и изменение данных в 1С не выполняется", и это свойство самого плагина, а не базы. Через мост ключ Алисы тоже выдается только на чтение. Запись через мост доступна агентам ChatGPT и Claude, с пробным прогоном по умолчанию, но в этом тесте она не проверялась: сравнивали чтение.

OData не сравнивали. Стандартный интерфейс OData есть в 1С давно, и агент в IDE может ходить в опубликованную базу через него. Но у Алисы такого входа нет: ее плагин работает только со своим протоколом. Сравнивать три модели там, где одна не участвует по определению, бессмысленно; OData для агентов это тема отдельного теста.

ChatGPT и Claude работали как агенты в IDE, Codex и Claude Code по ключу, а не как чат с коннектором или действие в своем GPT. Агент видит справку по структуре базы и подробные ошибки запросов, чат с коннектором получает то же самое, но проверять его отдельно мы не стали. Алиса работала как обычный чат в Яндекс 360.

Часть 2. Как тестировали

Базы

Две демонстрационные базы на стенде: "Бухгалтерия предприятия, редакция 3.0" с данными за 2015-2016 годы и "Управление торговлей, редакция 11" (11.5.25.112) с данными за 2022-2024 годы. Обе файловые. На время теста в базы никто не писал. Возраст данных не мешает: вопросы задаются про то, что в базе есть, с явными периодами.

Режимы

Каждая модель в двух режимах. Через Жёлтый мост: обработка в базе, ключ доступа, для Алисы адрес ключа в ее плагине. Штатно, без моста: у Алисы это ее плагин "1С:Предприятие" с публикацией базы на веб-сервере, расширением из комплекта Яндекса и служебным пользователем; у ChatGPT и Claude штатного способа нет. Для обоих режимов Алисы использовалась одна и та же база на одном стенде, только адрес в плагине разный.

Вопросы

Десять вопросов на базу, четыре группы с весами. Простые факты, вес 1: число элементов справочника, список организаций, реквизит одной позиции. Выборки с условием, вес 1: последние документы, документы за месяц с суммой, товары за месяц. Учет, вес 1,5: остатки по счету или складу, задолженность контрагентов. Многошаговые, вес 2: сравнение двух месяцев с процентом, товары на остатке без продаж за период. Максимум 13 баллов, результат в процентах от него.

Правила прогона: вопрос копируется дословно, в новый чат, одна попытка. Если модель уточняет, ответ берется из заранее заготовленного списка: "по всем организациям", "только проведенные", "на текущую дату", иначе "реши сам". Персональные данные в вопросах не участвуют: на ключах моста маскировка обязательная, и сравнивать маску с открытыми именами нельзя.

Эталон и оценка

Эталон снят до прогонов запросами к базе через мост и зафиксирован в файле. Снимал его Claude как агент, поэтому его результат на торговой базе это не слепой прогон, а сам эталон: все десять ответов получены им из базы и проверены. На бухгалтерской базе Claude дополнительно прошел тест обычным порядком, в новом чате и с одной попытки. Оценка ответа: 1, если совпал; 0,5, если совпал частично, например верный список с неверной суммой; 0, если неверно или нет ответа. Конкретные цифры без доступа к базе, выданные как данные базы, помечались бы как выдумка отдельно; таких случаев не было ни у кого.

Эталон исправлялся четыре раза, и это тоже результат теста. Claude нашел розничные продажи товара, который эталон считал непроданным. Алиса напрямую разложила сумму поступлений по валютам, а эталон складывал рубли с долларами. ChatGPT посчитал продажи по регистру выручки и вскрыл реализации "в пути", а на вопросе про штуки исключил кабели в метрах и нашел межфирменную передачу кондиционера. Все четыре случая проверены запросами к базе, в эталон внесены обе трактовки с пометкой, кто первым их дал. Прогоны, сделанные до исправления, не пересчитывались.

Что фиксировалось кроме точности

Время по часам от вопроса до ответа; у Алисы ее собственные оценки по вопросам не складывались, потому что она выполняет запросы параллельно. Число обращений к базе: для моста из журнала кабинета, для штатного плагина из лога стенда. Показала ли модель запрос. Есть ли выдумки.

Что дальше

Отдельный тест OData для агентов в IDE, слепой прогон Claude на торговой базе и проверка записи: как модели создают документы через пробный прогон и что происходит при повторе команды. Полные листы вопросов, эталон и все прогоны с оценками опубликованы как есть, ссылки в конце статьи.

Подключить свою базу и повторить тест можно за вечер: инструкции для каждой нейросети в кабинете, для Алисы отдельная статья как подключить без публикации базы. Протоколы теста целиком: бухгалтерская база и торговая база.