Содержание
TabFM в BigQuery: zero-shot прогнозы по таблицам через SQL
Google Cloud добавила в BigQuery поддержку TabFM — предобученной foundation-модели для табличных данных. Интеграция уже доступна в статусе Preview: аналитики и разработчики могут выполнять классификацию и регрессию функцией AI.PREDICT, не создавая и не обучая отдельную модель.
Что появилось в BigQuery
Вместо традиционного цикла с обучением, подбором гиперпараметров и ручной инженерией признаков TabFM использует in-context learning. В один вызов передаются исторические строки с известной целевой переменной и строки, для которых нужен прогноз. Если целевая колонка числовая, BigQuery выполняет регрессию; если она имеет тип STRING или BOOL — классификацию.
Для классификации результат включает не только предсказанную метку, но и вероятности по классам. Качество можно измерить отдельной функцией AI.EVALUATE: она возвращает метрики регрессии, включая MAE, MSE и R², либо метрики классификации — precision, recall, accuracy и F1.
Что стоит учитывать
Preview поддерживает не более 20 признаков и до 10 классов. Колонки признаков и целевая колонка должны иметь один из типов STRING, BOOL, INT64, FLOAT64, NUMERIC или BIGNUMERIC. Это делает TabFM удобным для быстрых экспериментов с оттоком клиентов, скорингом, обнаружением аномалий и другими задачами на структурированных данных, но не отменяет проверку качества на собственном наборе.
Во время Preview запросы оплачиваются слотами в редакциях Enterprise и Enterprise Plus либо по объёму обработанных данных при on-demand billing. Google предупреждает, что с 30 октября 2026 года добавит тарификацию по токенам TabFM, а обработка остальной части запроса продолжит учитывать слоты или байты.
Сама TabFM обучена на сотнях миллионов синтетических наборов данных. Google также открыла модель на Hugging Face и код в GitHub, поэтому облачную интеграцию можно сопоставить с локальными экспериментами.
Где попробовать
TabFM доступна в BigQuery Preview через функции AI.PREDICT и AI.EVALUATE. Для запуска нужен проект Google Cloud с BigQuery и подходящими таблицами или SQL-запросами.
Официальное подтверждение запуска опубликовано в release notes BigQuery от 31 августа 2026 года.
Как проверить TabFM в BigQuery
Подготовьте два набора строк
Соберите исторические строки с известной целевой колонкой и отдельные строки для прогноза в таблицах BigQuery или SQL-запросах.Проверьте схему
Оставьте не более 20 признаков поддерживаемых типов и укажите числовую цель для регрессии либо строковую или логическую цель для классификации.Запустите AI.PREDICT
Передайте обучающую и прогнозную выборки функции и задайте имя целевой колонки через label_col, если она называется не label.Измерьте качество
Вызовите AI.EVALUATE на отложенной выборке и сравните метрики TabFM с текущей моделью или простым базовым решением.Оцените стоимость
Проверьте объём обработанных данных или расход слотов и учтите переход к дополнительной тарификации токенов TabFM с 30 октября 2026 года.Коротко о TabFM в BigQuery
Нужно ли создавать и обучать модель BigQuery ML?
Нет. AI.PREDICT использует предобученную TabFM и получает примеры задачи из переданной обучающей таблицы или запроса.
Доступна ли функция в стабильном статусе GA?
Нет. Google обозначает поддержку TabFM в BigQuery как Preview.
Какие ограничения действуют в Preview?
Поддерживается до 20 признаков и до 10 категорий в задаче классификации.
Можно ли скачать TabFM отдельно от BigQuery?
Да. Google опубликовала веса модели на Hugging Face и исходный код в репозитории Google Research на GitHub.