Нейролюб
НовостьНейросетиAI-агентыClaude

Supabase открыла бенчмарк AI-кодинг-агентов — skills подняли Claude Sonnet 5 до 100%

Supabase выпустила открытый бенчмарк Evals для Claude Code, Codex и OpenCode. Агенты решают реальные задачи с базами данных, авторизацией и Edge Functions, а skills заметно улучшают результаты части моделей.

Кирилл Киреев

31.07.2026 · 4 минут чтения · Нейросети

Supabase Evals — бенчмарк AI-кодинг-агентов

Содержание

Supabase Evals проверяет AI-агентов на реальных проектах

Supabase открыла исходный код Supabase Evals — бенчмарка и фреймворка для проверки AI-кодинг-агентов. В тестах участвуют Claude Code, Codex и OpenCode: им предлагают не абстрактные задачи, а работу, знакомую разработчикам по реальным проектам — создать схему базы данных, найти причину сбоя Edge Function или исправить небезопасную RLS-политику.

Тесты идут в настоящем окружении Supabase

Каждый сценарий запускается против контейнерного стека Supabase с рабочими CLI и MCP-сервером. Результат проверяют комбинацией детерминированных тестов и LLM-судьи, а агент получает одну повторную попытку после ошибки. Опубликованные сценарии покрывают базу данных, авторизацию, хранилище, realtime, векторы и другие части платформы; отдельный набор регрессионных тестов обновляется ежедневно.

Skills особенно помогают не самым сильным моделям

В задачах этапа Build Claude Opus 5 и Kimi K3 набрали по 100% даже без подключённых skills. Для других моделей разница оказалась заметнее: Claude Sonnet 5 вырос с 78% до 100%, GPT-5.6 Sol — с 89% до 100%, а GPT-5.4 mini — с 78% до 89%. Supabase подчёркивает, что skills полезнее всего там, где модели нужно заменить устаревшие знания актуальными правилами платформы.

Что показало поведение Codex и Claude Code

Codex-агенты чаще обращались к документации: GPT-5.6 в среднем открывал около восьми страниц на сценарий, тогда как Claude Code — примерно две и использовал документацию менее чем в 40% запусков даже с подключёнными skills. Тесты также выявили типичные ошибки: агенты вручную пишут миграции вместо декларативных схем и не всегда выбирают новые библиотеки Supabase для безопасной авторизации.

Для разработчиков и команд это практичный способ сравнивать агентов не по общим рейтингам, а по задачам своего стека. Репозиторий выпущен под лицензией Apache 2.0, поэтому фреймворк можно запустить локально, добавить собственные сценарии и использовать как проверку перед обновлением модели, промптов или skills.

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Чиби Новости