Модели

CLIP

Мультимодальная модель, способная строить векторные представления текстов и изображений

date_range

Год выпуска: 2021

assignment

Описание

CLIP (Contrastive Language-Image Pre-training) – мультимодальная (работающая с несколькими модальностями данных) модель. CLIP сопоставляет тексту и изображению векторы из одного пространства, учитывающее семантику обеих модальностей. Так, например, векторное представление текста «собака и кошка, играющие во дворе» будет похоже на векторные представления изображений с собакой и кошкой, играющих во дворе и наоборот. Для обучения CLIP была использована объёмная обучающая выборка пар изображений и текстов, которые их описывают, а также Contrastive Learning. Идея Contrastive Learning заключается в том, что представления соответствующих объектов должны быть близки друг к другу, а представления разных объектов – далеки. Архитектурно CLIP состоит из двух моделей – Transformer для текста и ViT для изображений. В оригинальное статье было показано, что представления, извлекаемые ViT, который был обучен таким образом, более информативны, чем представления ViT, обученного классическим образом. Также мультимодальность CLIP позволяет решать задачу классификации изображений в Zero-Shot режиме. То есть модель может классифицировать изображения классов, которых не было в обучающей выборке. Для этого измеряется близость между изображением и представлениями текстовых описаний классов (например, текстовым описанием класса «синица» будет текст «фото синицы»): классом изображения будет тот класс, текстовое описание которого имеет наиболее близкое представление к представлению изображения.

Примеры использования:

  • Классификация изображений
  • Поиск изображений по тексту и наоборот
  • Использование представлений, извлечённых моделью, для генерации изображений по тексту и генерации описаний изображений, а также для решения многих задача компьютерного зрения

Нововведения

Модель способна преобразывать тексты и изображения в общее пространство

Количество параметров: 199M – 972M

Share

Recent Posts

В России принят первый закон об ИИ

Документ вводит юридическое определение искусственного интеллекта, а также суверенной и национальной языковых моделей. Им придется проходить проверку на соответствие традиционным…

27.07.2026

Муза с перфокартами: как компьютеры учились писать стихи за полвека до нейросетей

Генеративная поэзия появилась задолго до ChatGPT. Компьютеры генерируют стихи уже больше 60 лет, а сама мечта заставить машину рифмовать —…

24.07.2026

MLOps для работы с текстом: принципы и минимальный набор инструментов

Как специалисты по машинному обучению наводят порядок при работе с большими корпусами? Что нужно сделать, чтобы эксперимент был воспроизводимым, качество…

20.07.2026