Нейролюб
НовостьНейросетиAI-изображенияИсследования

MIT: AI-изображения из больших моделей часто нельзя связать с конкретными обучающими картинками

Исследователи MIT CSAIL обнаружили «распад атрибуции»: по мере роста датасета вклад отдельной картинки в результат генерации становится практически неразличимым.

Кирилл Киреев

18.08.2026 · 4 минут чтения · Нейросети

Иллюстрация MIT к исследованию атрибуции AI-изображений

Содержание

Что MIT выяснил о происхождении AI-изображений

Исследователи лаборатории MIT CSAIL описали эффект, который назвали attribution decay — «распадом атрибуции». Чем больше данных получает генеративная модель, тем слабее влияние каждого отдельного обучающего изображения на конкретный результат. В некоторых экспериментах учёные могли удалить одну картинку, все работы определённого автора или все фотографии конкретного человека — и итоговая генерация не менялась.

Как проверили вклад обучающих изображений

Обычные методы лишь приблизительно оценивают, какие данные повлияли на результат. Команда MIT собрала архитектуру diffusion ensemble из множества небольших компонентов, обученных на разных частях датасета. Нужный фрагмент данных можно было исключить, отключив видевшие его компоненты, без полного переобучения модели. Это позволило проводить точные контрфактические проверки: что сгенерировала бы система, если бы никогда не видела конкретную картинку.

Исследователи сравнили ансамбли с 24 обычными диффузионными моделями и работали с наборами от 256 до более чем 160 тысяч изображений из семи открытых коллекций. Во всех тестах по мере роста датасета максимальное влияние отдельного примера уменьшалось по степенному закону. Результат сохранился при разных метриках сходства, типах условий и даже при проверке методом полного переобучения на небольшом масштабе.

Почему это важно для художников и AI-сервисов

Работа усложняет привычную идею, что для каждого сгенерированного изображения можно составить точный список «источников вдохновения». Если удаление конкретной работы не меняет результат, причинно связать генерацию именно с ней становится трудно. Это важно для споров об авторском праве, лицензировании датасетов, компенсациях авторам и попытках определить, является ли результат производным произведением.

При этом исследование не означает, что вопросы согласия, законности сбора данных и копирования автоматически исчезают. Оно показывает более узкую вещь: техническая атрибуция конкретного результата отдельным обучающим примерам может стать ненадёжной уже на уровне устройства модели. Для создателей генераторов это одновременно аргумент и новая обязанность — уметь проверяемо демонстрировать, когда выдача действительно не зависит от конкретных защищённых работ.

Что пока остаётся неизвестным

Эксперименты проводились с диффузионными моделями, которые широко применяются для изображений, видео и научных задач. Переносится ли тот же эффект на большие языковые модели, пока неизвестно. Кроме того, работа не доказывает автоматически неатрибутируемость результатов всех коммерческих генераторов: она предлагает точный метод проверки и показывает устойчивую закономерность на исследованных архитектурах и датасетах.

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Перейти в Телеграм

Хочешь узнавать первым о таких новостях?

Переходи в наш телеграм канал где мы ежедневно публикуем самые свежие и интересные новости

Чиби Новости