Первые языковые модели работали только с текстом. Современные — мультимодальные: одна и та же модель может принять на вход изображение, аудио или видео и текст, и рассуждать о них в общем «пространстве смыслов». Это не просто добавление нового формата ввода — это принципиально другой способ представления информации внутри модели.
Как разные форматы становятся «одним языком» для модели
Текст превращается в токены. Изображение разбивается на участки (патчи), каждый из которых тоже превращается в вектор — числовое представление, сопоставимое по структуре с текстовыми токенами. Звук проходит похожий путь через спектрограммы или специальные аудиокодеки. В итоге модель работает не с «текстом» и «картинкой» по отдельности, а с единым потоком векторов, в котором неважно, из какой модальности они пришли.
Именно поэтому мультимодальная модель может, например, посмотреть на график, прочитать подпись под ним и ответить на вопрос, требующий сопоставить оба источника — то, что было почти невозможно для систем, где распознавание изображений и обработка текста были двумя разными, не связанными друг с другом моделями.
Зачем это нужно на практике
Мультимодальность открывает сценарии, недоступные текстовым моделям: анализ скриншотов интерфейса для автоматизации (в том числе работа агентов с компьютером «как видит человек»), разбор сканов документов вместе с их структурой, описание и индексация видео по содержанию кадров и звуковой дорожки одновременно, голосовые ассистенты, которые реагируют на интонацию, а не только на распознанный текст.
Ограничения, о которых редко говорят
Мультимодальные модели по-прежнему хуже справляются с точным счётом объектов на изображении, мелким текстом на фотографиях низкого качества и пространственными отношениями («что находится слева от того, что справа от стола»). Это не случайность: обучающие данные для изображений устроены иначе, чем для текста, и задачи точного пространственного рассуждения в них представлены слабее.
Мультимодальная модель «видит» изображение не так, как человек — она видит набор признаков, похожих по структуре на слова, а не непрерывную картинку.
Главное
- Мультимодальные модели переводят текст, изображение, звук и видео в единое числовое представление и рассуждают о них вместе.
- Это открывает задачи на стыке модальностей: анализ интерфейсов, документов, видео по содержанию и звуку.
- Точный счёт объектов и пространственные отношения на изображениях пока остаются слабым местом таких моделей.