Содержание
Supabase Evals проверяет AI-агентов на реальных проектах
Supabase открыла исходный код Supabase Evals — бенчмарка и фреймворка для проверки AI-кодинг-агентов. В тестах участвуют Claude Code, Codex и OpenCode: им предлагают не абстрактные задачи, а работу, знакомую разработчикам по реальным проектам — создать схему базы данных, найти причину сбоя Edge Function или исправить небезопасную RLS-политику.
Тесты идут в настоящем окружении Supabase
Каждый сценарий запускается против контейнерного стека Supabase с рабочими CLI и MCP-сервером. Результат проверяют комбинацией детерминированных тестов и LLM-судьи, а агент получает одну повторную попытку после ошибки. Опубликованные сценарии покрывают базу данных, авторизацию, хранилище, realtime, векторы и другие части платформы; отдельный набор регрессионных тестов обновляется ежедневно.
Skills особенно помогают не самым сильным моделям
В задачах этапа Build Claude Opus 5 и Kimi K3 набрали по 100% даже без подключённых skills. Для других моделей разница оказалась заметнее: Claude Sonnet 5 вырос с 78% до 100%, GPT-5.6 Sol — с 89% до 100%, а GPT-5.4 mini — с 78% до 89%. Supabase подчёркивает, что skills полезнее всего там, где модели нужно заменить устаревшие знания актуальными правилами платформы.
Что показало поведение Codex и Claude Code
Codex-агенты чаще обращались к документации: GPT-5.6 в среднем открывал около восьми страниц на сценарий, тогда как Claude Code — примерно две и использовал документацию менее чем в 40% запусков даже с подключёнными skills. Тесты также выявили типичные ошибки: агенты вручную пишут миграции вместо декларативных схем и не всегда выбирают новые библиотеки Supabase для безопасной авторизации.
Для разработчиков и команд это практичный способ сравнивать агентов не по общим рейтингам, а по задачам своего стека. Репозиторий выпущен под лицензией Apache 2.0, поэтому фреймворк можно запустить локально, добавить собственные сценарии и использовать как проверку перед обновлением модели, промптов или skills.