Категорія
Новини
Дата

Зображення як реальні. OpenAI представила ChatGPT Images 2.0 з коректним текстом і деталізацією до 2K

1 хв читання

Поширити

OpenAI запустила нову модель генерації зображень ChatGPT Images 2.0, яка значно покращує якість тексту на картинках і деталізацію. Інструмент уже доступний користувачам ChatGPT і дозволяє створювати складні зображення – від меню до коміксів – за кілька хвилин, пише TechCrunch.

Заощаджуйте, отримуючи 6 журналів за ціною 4

Купуйте річну передплату на шість журналів Forbes Ukraine за 1 799 грн замість 2 400 грн. Читайте головні історії українського бізнесу, ексклюзивні рейтинги та глибоку аналітику в кожному номері.

Купити

Деталі 

  • Нове покоління генерації зображень суттєво скорочує розрив між роботами людини і штучного інтелекту. Якщо ще два роки тому моделі створювали тексти з помилками на кшталт вигаданих назв страв, то Images 2.0 генерує зображення, які можна використовувати без помітних неточностей, зазначило видання.
  • Раніше генератори зображень мали труднощі з текстом через використання дифузійних моделей, які відновлюють зображення з шуму і приділяють менше уваги дрібним елементам. Нові підходи, зокрема авторегресивні моделі, дозволили підвищити точність.
  • OpenAI не розкрила технічну основу Images 2.0, але зазначила, що модель має «можливості мислення». Вони дозволяють перевіряти результати, генерувати кілька варіантів одного зображення та адаптувати їх під різні формати – наприклад, маркетингові матеріали або багатокадрові комікси.
  • Модель краще працює з не латинськими мовами, зокрема японською, корейською, хінді та бенгальською. Водночас її база знань обмежена груднем 2025 року, що може впливати на актуальність деяких зображень.
  • За заявою компанії, Images 2.0 забезпечує високу точність деталей – від дрібного тексту та іконок до складних композицій – із роздільною здатністю до 2K. Генерація складних зображень займає кілька хвилин.
  • Інструмент доступний усім користувачам ChatGPT і Codex, водночас платні підписники отримають доступ до більш просунутих функцій. Також компанія відкриває API gpt-image-2 з ціноутворенням залежно від якості і роздільної здатності.

Контекст 

Ринок генеративного ШІ стрімко рухається від експериментальних рішень до прикладних інструментів для бізнесу – від маркетингу до дизайну.

Поліпшення якості тексту на зображеннях було одним із ключових бар’єрів для масового використання таких моделей. Запуск Images 2.0 може прискорити їх інтеграцію в робочі процеси компаній, де важлива точність візуального контенту. 

Матеріали по темі

Ви знайшли помилку чи неточність?