Модели

ViT

Модель с архитектурой Transformer для работы с изображениями

date_range

Год выпуска: 2020

assignment

Описание

ViT (Vision Transformer) – модель с архитектурой Transformer, предназначенная для работы с изображениями. Изначально архитектура Transformer была изобретена для работы с последовательностями (в сущности – с текстовыми последовательностями). Поэтому перед тем, как подать изображение на вход модели, оно преобразовывается в последовательность: изображение делится на непересекающиеся фрагменты одинаковых размеров. Затем полученный набор фрагментов обрабатывается стандартным Transformer’ом. В отличие от свёрточных нейросетей в архитектуре ViT практически не используются специфичные знания о домене изображений. Таким образом, ViT стал очередным подтверждением того, что Transformer – это универсальная и при этом эффективная архитектура. ViT достигает более высокое качество решения задач, чем классические свёрточные сети, а также легче масштабируется. Однако для обучения ViT необходимо больше данных. 

Примеры использования:

Классификация изображений, детекция объектов на изображении, сегментация изображений

Нововведения

Адаптация архитектуры Transformer под домен изображений

Количество параметров: 86M-632M

Share

Recent Posts

В России принят первый закон об ИИ

Документ вводит юридическое определение искусственного интеллекта, а также суверенной и национальной языковых моделей. Им придется проходить проверку на соответствие традиционным…

27.07.2026

Муза с перфокартами: как компьютеры учились писать стихи за полвека до нейросетей

Генеративная поэзия появилась задолго до ChatGPT. Компьютеры генерируют стихи уже больше 60 лет, а сама мечта заставить машину рифмовать —…

24.07.2026

MLOps для работы с текстом: принципы и минимальный набор инструментов

Как специалисты по машинному обучению наводят порядок при работе с большими корпусами? Что нужно сделать, чтобы эксперимент был воспроизводимым, качество…

20.07.2026