Учора світ дізнався про неймовірний революційний репорт від OpenAI, присвячений GPT-4V - найпотужнішій версії трансформерної моделі. У 166-сторінковому документі описуються приголомшливі можливості цієї машини, і світ просто схвильований!
GPT-4V виявився не просто удосконаленням своїх попередників, а справжньою інтелектуальною революцією. Багато хто припускав, що сфера обробки природної мови (NLP) була на піку, але GPT-4V довів зворотне. Він не тільки вміє описувати зображення, як це роблять класичні моделі, а й володіє глибоким розумінням контексту візуальної та текстової інформації.
Сюрпризом стала його здатність розпізнавати емоції людей на фотографіях, а також робити точні діагнози за КТ і МРТ знімками. Навіть бородаті фахівці в галузі Computer Vision були вражені тим, як GPT-4V увірвався на їхню територію і почав вирішувати найскладніші візуальні завдання.
Крім цього, GPT-4V навчається на few-shot прикладах і аналізує графіки, розпізнає інгредієнти в стравах, ідентифікує людей і навіть розуміє схеми, діаграми і формули. Він може виконувати навігацію по графічних елементах дизайну і навіть допомагати у вирішенні завдань навігації роботів у реальному світі на основі двомірних фотографій.
І це тільки початок! GPT-4V не просто ще одна модель, це частина GPT-4, що означає, що всі вже знайомі нам функції, як-от промтінг, RAG і агенти, автоматично доступні і для GPT-4V.
Найдивовижніше в цій новині - GPT-4V буде доступний усім через місяць! Безліч користувачів уже висловили свій інтерес і нетерпіння на Twitter. Цей крок OpenAI обіцяє змінити ландшафт штучного інтелекту назавжди, і ми з нетерпінням чекаємо, що принесе майбутнє з цією дивовижною технологією. Stay tuned!

NCAGE Number: A4E8J