تحديث كبير لـ DeepSeek أخيرًا "فتح العينين"

ظننت أن هذا الجنون في تحديثات الذكاء الاصطناعي قد انتهى بالفعل، لكن المفاجأة جاءت الأسبوع الماضي فقط بعد إصدار DeepSeek V4، وفجأة ظهرت مفاجأة أكبر.

قبل قليل، تم إطلاق وضع التعرف على الصور في DeepSeek، ويظهر أنه في الاختبار التجريبي. هذا يعني أن القدرة متعددة الوسائط التي ناقشناها على مدار عام كامل في DeepSeek، قد أصبحت أخيرًا متاحة!

حاليًا، يمكن أن يتم اختبار وضع التعرف على الصور في نسخة الويب وتطبيق DeepSeek بعد التحديث، وأجرت APPSO الاختبار مباشرة.

المهندس المسؤول عن الأبحاث متعددة الوسائط في DeepSeek، تشن شياوكوانغ، نشر على X: الآن، نراك، وأرفق صورة، ودعونا نسمح لـ DeepSeek أن يفسر معنا معنى هذه الصورة.

النتيجة تظهر أنه قادر على التعرف على الرمزية وراء هذه الصورة، على الرغم من عدم وجود أي كلمات تتعلق بـ DeepSeek في الصورة، لكنه استنادًا إلى التعرف على هوية المنشئ والصورة، استنتج أن الأمر يتعلق بتحديث قدرات DeepSeek متعددة الوسائط.

وفي النهاية، قدم ملخصًا دقيقًا جدًا: الحوت الذي لا يرى العالم الآن أخيرًا فتح عينيه.

بالنسبة لنا، أكثر من مجرد النتائج، فإن عملية التفكير التي يقوم بها DeepSeek في وضع التعرف على الصور أكثر إثارة للاهتمام.

في الماضي، عند رؤية لقطة من تويتر، كان من المرجح أن يصفها بصدق: "حوتان أزرقان، أحدهما يرتدي نظارة على اليسار، والآخر لا يرتدي."

لكن DeepSeek يبدأ فورًا في طرح الأسئلة: من هو هذا الشخص؟ لماذا نشر هذا؟ ماذا يمثل شعار الحوت؟ ماذا يرمز XX على النظارة؟

هذه هي الأمور التي تحدث في أذهاننا حقًا عندما نرى صورة فكاهية. لا أحد يبدأ بعدد الحيتان، ما نهتم به هو من يتحدث مع من، وما هو المعنى الضمني.

وهو أيضًا يصحح نفسه مرارًا وتكرارًا.

على سبيل المثال، حتى أنه ربط النظارة في الصورة بشخصية كاميونا في "تسونين توبراكس"، ثم قام بتوبيخه بنفسه: "لا، هذا أكثر توجهًا للمهووسين بالأنمي." "انتظر، انظر عن كثب..." "من زاوية أخرى...".

كل تلك الاستنتاجات، والارتباطات، وتصحيح الذات كانت مثيرة جدًا. لكن الجزء الأكثر غرابة في عملية التفكير هو عندما كان يقترب من النهاية، فجأة توقف وقال: "انتظر، دعني أوقف نفسي، وأعقد جلسة دفاع صغيرة لنفسي."

طرح ثلاثة أسئلة على نفسه وأجاب عليها، بداية بتأكيد الحقائق الموضوعية، ثم استنتاج طبيعة الحدث، وأخيرًا تفسير الصورة. جعل DeepSeek هذا النمط من التفكير، الذي لم ندركه نحن أنفسنا، جزءًا من منطق التفكير في التعرف على الصور.

تمامًا كما نفكر قبل الوصول إلى استنتاج، نمر على أفكار مثل: "انتظر، هل هذا الافتراض صحيح؟ هل هذا الافتراض منطقي؟ ماذا لو فهمت الأمر بشكل خاطئ؟"

كما أننا ألقينا على DeepSeek اختبارًا كلاسيكيًا للذكاء الاصطناعي — عد الأصابع.

فكر قليلاً، وأجاب خطأ، وعلق قائلًا: "أنا فعلاً تعبت من العد."

لكن إذا قمت بتوجيهه مرة أخرى، يمكنه أن يجيب بشكل صحيح.

وفي اختبار آخر لعد الأصابع، بعد أن أخطأ في الإجابة الأولى، لم أعطه الإجابة، فقط طلبت منه أن يفكر مرة أخرى، واستطاع أن يعطي الإجابة الصحيحة.

جربنا أيضًا اختبار "القلب" الكلاسيكي، والذي كان قد عجز عنه جميع الذكاء الاصطناعي سابقًا، ولم يتمكن DeepSeek من التعرف عليه أيضًا.

بعيدًا عن هذه الاختبارات الصعبة، أظهرت الاختبارات الأولية لـ APPSO أن دقة التعرف على الصور في DeepSeek لا تزال عالية جدًا، وبدون وضع التفكير، يمكنه حتى أن يجيب خلال نصف ثانية.

على سبيل المثال، التعرف على صورة من مشهد فيلم، من المحتمل أن يكون موجودًا بالفعل في قاعدة البيانات.

كما أن فهم الصور المجردة كان جيدًا جدًا.

وفهم صورة منتج من يونيكلو لم يكن مشكلة أيضًا.

لكن عملية التعرف على الصور هذه لا تتصل بالإنترنت للبحث، وتعتمد فقط على قاعدة المعرفة، لذلك بعض الأشياء الجديدة، مثل شخصية Finder الجديدة من آبل، لا يمكن التعرف عليها.

وأيضًا، هناك قيود على تنسيق الملفات التي يدعمها وضع التعرف على الصور، مثل عدم دعم تنسيق HEIF.

إطلاق وضع التعرف على الصور في DeepSeek يعني أن هذا الحوت أخيرًا فتح عينيه، لكن ربما يكون مجرد بداية.

قد تتطور قدرات DeepSeek متعددة الوسائط بسرعة، ومع تحديثها، قد يتغير شكل السوق للنماذج المحلية مرة أخرى.

ستواصل APPSO مشاركة تجاربها مع وضع التعرف على الصور في DeepSeek، وندعو الجميع لتجربته ومشاركة النصائح والتفاصيل المثيرة التي يكتشفونها.

شاهد النسخة الأصلية
قد تحتوي هذه الصفحة على محتوى من جهات خارجية، يتم تقديمه لأغراض إعلامية فقط (وليس كإقرارات/ضمانات)، ولا ينبغي اعتباره موافقة على آرائه من قبل Gate، ولا بمثابة نصيحة مالية أو مهنية. انظر إلى إخلاء المسؤولية للحصول على التفاصيل.
  • أعجبني
  • تعليق
  • إعادة النشر
  • مشاركة
تعليق
إضافة تعليق
إضافة تعليق
لا توجد تعليقات
  • مُثبت