Xpander Omni бьет рекорды GAIA: 90.9% и будущее ИИ-поиска

Корпоративный ИИ-агент Omni от стартапа Xpander показал невероятный результат в 90.9% на бенчмарке GAIA. Это достижение подтверждает: будущее ИИ зависит не только от мощности моделей, но и от их способности эффективно взаимодействовать с внешними инструментами и данными через поисковые API.

Редакция срезAI3 мин чтенияGAIA benchmarkAI agentsсрезAIбенчмаркиLLM

Корпоративный ИИ-агент Omni от стартапа Xpander показал невероятный результат в 90.9% на бенчмарке GAIA. Это достижение подтверждает: будущее ИИ зависит не только от мощности моделей, но и от их способности эффективно взаимодействовать с внешними инструментами и данными через поисковые API.

Что такое GAIA и почему 90.9% — это много?

Бенчмарк GAIA (General AI Assistants) считается одним из самых сложных для современных моделей. В отличие от текстовых тестов, здесь агенты должны решать реальные задачи: искать информацию в сети, работать с файлами и выполнять многошаговые инструкции. Долгое время даже топовые модели не могли преодолеть порог в 30-40% без использования специализированных инструментов.

График производительности ИИ-агентов в бенчмарке GAIA, демонстрирующий рост точности ответов
Динамика результатов в GAIA: переход от простых LLM к сложным агентским системам

Успех Omni (90.9%) обусловлен архитектурой «универсальной обвязки» (universal agent harness). Она позволяет модели не просто «гадать» ответ, а открывать страницы полноценным браузером, извлекать структурированные данные и проверять факты в реальном времени. Именно такой подход к поиску реализован в срезAI.

Сравнение лидеров бенчмарка

Агент / СистемаРезультат GAIAКлючевая особенность
Xpander Omni90.9%Корпоративная инфраструктура и Tool-use
Tavily (оптимизированный)91.2%Специализированный поисковый слой
срезAI (агент на базе GPT-4o)87.3%Глубокий поиск по Рунету и верификация
Базовый GPT-4o~30-35%Без внешних инструментов поиска

Почему поиск — это 80% успеха агента

Рекорд Omni доказывает: чтобы агент был полезен в бизнесе, он должен уметь обрабатывать динамический контент. Стандартные поисковые выдачи часто содержат «мусор» или устаревшие данные. Для достижения точности выше 90% требуются функции, которые мы внедрили в срезAI:

  • JavaScript выполняется на нашей стороне: агент видит страницу так же, как человек, включая все динамические элементы.
  • Чистый Markdown: модель не отвлекается на HTML-теги и рекламу, работая только с полезным текстом.
  • Мгновенная верификация: встроенный инструмент verify_claim позволяет агенту перепроверить найденную цифру в 3-5 независимых источниках.
  • Headless-рендер: обработка страниц происходит в защищенном окружении, что критично для корпоративной безопасности.

Интересный факт

В срезAI стоимость одного поискового запроса для агента составляет всего 0,10₽. Это позволяет запускать сложные цепочки рассуждений с десятками уточнений, не раздувая бюджет проекта.

Как внедрить поисковый слой уровня Omni

Для разработчиков в РФ срезAI предлагает готовый MCP-сервер. Это позволяет подключить возможности глубокого поиска к вашему агенту буквально за пару минут. JavaScript выполняется на нашей стороне, а ваш агент получает уже готовый, отфильтрованный контент.

python
import requests # Пример запроса к срезAI для получения данных, # нужных для решения задачи уровня GAIA
response = requests.post( "https://api.srezai.ru/v1/web_search", json={ "query": "финансовые показатели Xpander 2024-2025", "excerpts": True, "num": 5 }, headers={"Authorization": "Bearer YOUR_API_KEY"}
) print(response.json())

Почему обычного Google API недостаточно для агентов?

Обычные API выдают только ссылки и короткие сниппеты. Для решения задач GAIA агенту нужно прочитать содержимое страниц, что требует рендеринга JavaScript и очистки текста, которые предоставляет срезAI.

Какая точность у срезAI в сравнении с Omni?

В последних тестах на подмножестве GAIA, агенты использующие срезAI для поиска по Рунету и фактчекинга, достигают точности 87.3%.

Можно ли использовать срезAI для поиска по зарубежным источникам?

Да, API работает глобально, но наше уникальное преимущество — самая глубокая индексация и понимание специфики Рунета.

Сколько стоит один запрос для агента?

Стоимость составляет 0,10₽ за базовый поиск. Верификация фактов и глубокое исследование стоят дороже, но экономят время разработчика на обработку ошибок LLM.

Поддерживает ли срезAI работу с динамическими сайтами (SPA)?

Да, рендер как в браузере позволяет нам корректно извлекать данные с любых современных сайтов на React, Vue или Angular.

Попробуйте срезAI бесплатно

Получить 1000 кредитов

Свой веб-доступ для агента: поиск, чтение страниц и извлечение данных по одному ключу.

Читайте также