آبل تطور نموذجًا لغويًا لفهم الفيديوهات الطويلة بكفاءة عالية
25 أغسطس 2025
أعلنت شركة Apple عن تطوير نموذج لغوي كبير قادر على تحليل وفهم الفيديوهات الطويلة بكفاءة غير مسبوقة. النموذج الجديد يحمل اسم SlowFast-LLaVA-1.5، وهو نسخة محسّنة من نموذج مفتوح المصدر يُعرف باسم SlowFast-LLaVA، وقد أثبت تفوقه على نماذج أكبر منه في الحجم في العديد من المهام المتعلقة بالفيديو.
وعند تدريب نموذج لغوي لفهم الفيديو، يتم تقسيم الفيديو إلى إطارات، ثم تُستخدم تقنيات الرؤية الحاسوبية لاستخلاص الميزات البصرية من كل إطار. بعد ذلك، يتم تحليل تغير هذه الميزات عبر الزمن وربطها باللغة، بحيث يستطيع النموذج وصف محتوى الفيديو أو تفسيره نصيًا.
أعلنت شركة Apple عن تطوير نموذج لغوي كبير قادر على تحليل وفهم الفيديوهات الطويلة بكفاءة غير مسبوقة
لكن تحليل كل إطار على حدة يؤدي إلى تكرار كبير في المعلومات، لأن معظم الإطارات لا تختلف كثيرًا عن بعضها البعض. هذا التكرار يستهلك مساحة كبيرة من "نافذة السياق" الخاصة بالنموذج، وهي الحد الأقصى للمعلومات التي يمكن للنموذج الاحتفاظ بها في وقت واحد. وعندما تتجاوز هذه النافذة، يبدأ النموذج في تجاهل المعلومات القديمة لإفساح المجال للمعلومات الجديدة، مما يؤثر على دقة التحليل.
بحسب الورقة البحثية التي نشرتها Apple، فإن النماذج الحالية تعاني من ثلاث مشكلات رئيسية:
- الاعتماد على عدد كبير من الإطارات وسياقات طويلة، مما يجعلها غير فعالة وغير قابلة للتطبيق على نماذج أصغر.
- الحاجة إلى عمليات تدريب معقدة متعددة المراحل، غالبًا باستخدام بيانات خاصة يصعب الوصول إليها.
- التركيز على مهام الفيديو فقط، مما يحد من قدرتها على العمل كنماذج متعددة الأغراض تشمل الصور أيضًا.
وللتغلب على هذه التحديات، اعتمدت Apple على نموذج SlowFast-LLaVA الذي يستخدم تقنية "التيار المزدوج". يتضمن هذا النظام تيارين:
- تيار بطيء يعالج عددًا قليلًا من الإطارات بدقة عالية لفهم محتوى المشهد.
- تيار سريع يعالج عددًا أكبر من الإطارات بدقة أقل لتتبع الحركة والتغيرات الزمنية.
قامت Apple أولًا بتدريب النموذج على الصور لبناء قدرات عامة في الاستدلال البصري، ثم دربته بشكل مشترك على الصور والفيديوهات باستخدام مجموعات بيانات عامة، مما سمح له بفهم البنية الزمنية دون التضحية بقدراته في تحليل الصور.
النموذج الجديد، الذي يتوفر بأحجام مختلفة (1 مليار، 3 مليارات، و7 مليارات معامل)، تفوق على نماذج أكبر منه في اختبارات متعددة، منها LongVideoBench وMLVU، وحقق نتائج قياسية حتى في نسخته الأصغر.
كما أثبت النموذج كفاءته في مهام الصور، مثل التعرف البصري، حل المسائل الرياضية، التعرف على النصوص، والتعامل مع سيناريوهات غنية بالمعلومات النصية.
ورغم النجاح الكبير، لا يخلو النموذج من بعض القيود. إذ يقتصر على معالجة 128 إطارًا فقط من أي فيديو، بغض النظر عن طوله. يتم اختيار 96 إطارًا للتيار السريع و32 إطارًا للتيار البطيء بشكل متساوٍ عبر مدة الفيديو.
هذا التقييد قد يؤدي إلى فقدان بعض الإطارات المهمة أو إلى سوء تقدير سرعة تشغيل الفيديو. كما أن تحسين النموذج بشكل كامل يتطلب موارد ضخمة من ذاكرة وحدات معالجة الرسوميات، مما يجعل الأمر غير بسيط. وقد اقترح الباحثون استكشاف تقنيات لتقليل استهلاك الذاكرة في الدراسات المستقبلية.
نموذج SlowFast-LLaVA-1.5 متاح الآن كمصدر مفتوح على منصتي GitHub وHugging Face، ويمكن للباحثين والمطورين استخدامه بحرية. وقد تم تدريبه بالكامل على مجموعات بيانات عامة، مما يعزز من شفافيته وقابليته للتطوير.