Глибоке пошук велике оновлення нарешті «відкрив очі»

Спочатку я думав, що ця шалена оновлення штучного інтелекту вже закінчилася, але нещодавно минулого тижня було випущено DeepSeek V4, і раптом з’явився ще більший сюрприз.

Щойно, DeepSeek запустив режим розпізнавання зображень, який наразі перебуває у тестовому режимі. Це означає, що багато місяців обговорювані мультимодальні можливості DeepSeek нарешті з’явилися!

Зараз оновлення веб-версії DeepSeek та додатку можуть бути у тестовому режимі з режимом розпізнавання зображень, і APPSO одразу провів перше тестування.

На X-сторінці дослідник мультимодальних технологій DeepSeek Чень Сяокан опублікував: "Now, we see you", — і додав зображення. Ми дозволимо DeepSeek розтлумачити, що означає це зображення.

Результати показали, що він може розпізнати метафору за цим зображенням, хоча у ньому немає жодних слів про DeepSeek, але завдяки розпізнаванню особистості публікатора та зображення, він зробив висновок, що йдеться про оновлення мультимодальних можливостей DeepSeek.

Наприкінці він дав дуже точний висновок: "Цей кит, який не бачить світ, нарешті відкрив очі."

Порівняно з відповіддю, APPSO вважає, що процес роздумів DeepSeek у режимі розпізнавання зображень є ще цікавішим.

Раніше штучний інтелект, дивлячись на цей скріншот у Твіттері, швидше за все, просто описував би: "Дві сині кити, зліва в окулярах, справа без окулярів."

Але DeepSeek одразу починає ставити запитання: Хто цей людина? Чому він це опублікував? Що означає логотип кита? Що натякає "XX" на окулярах?

Саме так у нашій голові відбувається, коли ми натрапляємо на мем. Ніхто не рахує кількість китів, нас цікавить, хто кому говорить і які приховані сенси закладені.

Крім того, він може сам себе коригувати.

Наприклад, він навіть колись порівняв окуляри на зображенні з окулярами Каміни з "Тенгю Бураку" і сам себе заперечив: "Ні, це занадто нішевий стиль." "Почекай, подивимось ще раз..." "Зміню ще ракурс..."

Ці логічні роздуми, асоціації та самокорекція дуже цікаві. Але найпротилежною логікою у цьому процесі є те, що наприкінці він раптово зупинився і провів невеликий захист своєї думки.

Він поставив собі три питання і відповів на них, спочатку підтверджуючи об’єктивні факти, потім роблячи припущення про суть події, і лише потім даючи інтерпретацію. DeepSeek зробив цю звичку мислення, яку ми самі навіть не усвідомлювали, частиною логіки розпізнавання зображень.

Як і перед тим, як зробити висновок, ми зазвичай проговорюємо в голові: "Почекай, чи правильний цей передумова? Чи обґрунтоване це припущення? А що, якщо я неправильно зрозумів напрямок?"

Ми також кинули класичний тест штучного інтелекту — підрахунок кількості пальців — до DeepSeek.

Він подумав і відповів неправильно, навіть пожартував: "Я справді заплутався з підрахунком." Але якщо я трохи його підведу, він зможе дати правильну відповідь.

Ще один тест з підрахунку пальців — після першої неправильної відповіді я не давав правильну відповідь, а просто попросив його подумати ще раз, і він зміг відповісти правильно.

Ми також спробували класичний тест "серце", і цей знімок раніше вводив у глухий кут усіх AI, але DeepSeek також не зміг його розпізнати.

Відмовляючись від цих складних тестів, APPSO зробив попередні висновки, що точність розпізнавання зображень DeepSeek досить висока, і без режиму роздумів він може давати відповіді за півсекунди.

Наприклад, розпізнавання кадру з фільму, ймовірно, вже є у базі даних.

Розуміння абстрактних зображень також дуже точне.

Розуміння товару Uniqlo також без проблем.

Але процес розпізнавання зображень, ймовірно, не передбачає підключення до інтернету для пошуку, а базується лише на знаннях. Тому деякі нові речі, наприклад, новий символ компанії Apple — Finder-чан, — можуть бути не розпізнані.

Крім того, формат файлу для завантаження у режимі розпізнавання зображень має обмеження, наприклад, не підтримує формат HEIF.

Запуск режиму розпізнавання зображень DeepSeek означає, що цей кит нарешті відкрив очі, але можливо, це лише початок.

Багатомодальні можливості DeepSeek дуже швидко можуть поповнюватися новими функціями, і після заповнення цієї прогалини весь ландшафт вітчизняних моделей може знову зазнати тонких змін.

APPSO продовжить ділитися з вами досвідом роботи з режимом розпізнавання зображень DeepSeek і запрошує всіх поділитися цікавими порадами та деталями після тестування.

Переглянути оригінал
Ця сторінка може містити контент третіх осіб, який надається виключно в інформаційних цілях (не в якості запевнень/гарантій) і не повинен розглядатися як схвалення його поглядів компанією Gate, а також як фінансова або професійна консультація. Див. Застереження для отримання детальної інформації.
  • Нагородити
  • Прокоментувати
  • Репост
  • Поділіться
Прокоментувати
Додати коментар
Додати коментар
Немає коментарів
  • Закріплено