بايت دانس تطلق سيدانس 2.5 لتوليد فيديو حتى 30 ثانية بصوت مدمج و50 مدخلاً مرجعياً، في يوم يشهد سباقاً صينياً على نماذج الفيديو بينما تنسحب OpenAI من سورا.
أطلقت بايت دانس رسمياً نموذج Seedance 2.5 لتوليد الفيديو في 31 يوليو 2026، في اليوم نفسه الذي كشفت فيه MiniMax عن نموذجها H3، ضمن سباق صيني متزامن على نماذج توليد الفيديو بالذكاء الاصطناعي بينما تنسحب OpenAI من سورا. ينتج النموذج مقاطع حتى 30 ثانية في تمريرة واحدة مع صوت مدمج، ويقبل حتى 50 مدخلاً مرجعياً في الطلب الواحد.

بايت دانس تطلق سيدانس 2.5 في يوم سباق صيني على نماذج الفيديو
أعلن فريق Seed التابع لبايت دانس الإطلاق الرسمي للنموذج عبر مدونته: «اليوم، نطلق رسمياً سيدانس 2.5». وكان النموذج قد كُشف عنه لأول مرة في مؤتمر FORCE لمنصة Volcano Engine في بكين في 23 يونيو 2026، مع استهداف إطلاقه في أوائل يوليو، كما وثّقت The Decoder.
لم يكن التوقيت مصادفة؛ ففي اليوم نفسه أطلقت MiniMax نموذج H3، وقالت بلومبرغ إن الشركتين أطلقتا تحديثات لنموذجيهما خلال ساعات من بعضهما، في تأكيد على التقدم الذي جعل الصين تتصدر على الولايات المتحدة في هذا المجال. وتأتي هذه الوتيرة الصينية في سياق أوسع توثقه خريطة نماذج الذكاء الاصطناعي في منتصف 2026، التي ترصد هيمنة النماذج الصينية وانهيار أسعار الاستدعاء.
وفي المقابل، أوقفت OpenAI واجهة Videos API ونماذج سورا 2 في 24 مارس 2026، مع إغلاق نهائي مجدول في 24 سبتمبر 2026، بينما تتصاعد المنافسة بين النهج الصيني والأمريكي في ملفات أوسع، كما يوضح تحليل أمريكا بلا استراتيجية مفتوحة المصدر.
يُطرح النموذج تدريجياً على تطبيقي Jimeng AI وDoubao Pro، بينما سيتوفر الـ API «قريباً» عبر BytePlus ModelArk، وقد يصل أيضاً إلى منصة Ark التابعة لـ Volcano Engine، كما نقلت TechNode.
30 ثانية في تمريرة واحدة: ما الجديد في التوليد؟
رفعت بايت دانس سقف التوليد أحادي التمريرة من 15 ثانية في سيدانس 2.0 إلى 30 ثانية، مع إمكانية التمديد متعدد الجولات لإنتاج مقاطع تدوم دقائق مع ثبات الشخصيات والبيئة والإيقاع السردي. كما حسّنت الشركة انتقالات اللقطات والمشاهد لاستمرارية أقوى في الفيديوهات الطويلة، إلى جانب تحسينات في جودة الصورة والصوت والحركة، شملت القوام وملامح البشرة والعينين والإضاءة وتشبع الألوان.
ويستند النموذج إلى معمارية سيدانس 2.0 الموحّدة للتوليد المشترك للصوت والفيديو، ما يعني أن الصوت يُنتج ضمن التمريرة نفسها بدلاً من إضافته لاحقاً. ووصف The Decoder التحديث بأنه يكسر حاجز 30 ثانية في توليد الفيديو بالذكاء الاصطناعي، مع انتقالات مشاهد وتغيرات إيقاعية داخل المقطع الواحد دون أي وصل لاحق.
حتى 50 مدخلاً مرجعياً: كيف تعمل المرجعية متعددة الوسائط؟
يمكن للمستخدم إدخال حتى 30 صورة و10 مقاطع فيديو و10 مقاطع صوتية كمواد مرجعية في طلب واحد، أي ما مجموعه 50 مدخلاً، كما أعلن فريق Seed. عملياً، يعني هذا أن صانع المحتوى يستطيع تحديد ملامح شخصية من صور، وحركة أو أسلوب تصوير من مقاطع فيديو، وأداء صوتياً أو مؤثرات من مقاطع صوتية، ثم يبني النموذج المشهد على هذه المدخلات مجتمعة.

وهذا الحجم من المراجع مفيد خصوصاً في مشاهد الأفلام التي تضم شخصيات متعددة، حيث يحتاج كل عنصر إلى ثبات بصري وصوتي داخل المشهد نفسه، كما رصدت The Decoder.
Clay Render والتحرير بمستوى الطابع الزمني: أدوات للمحتوى الاحترافي
تضيف بايت دانس أداة Clay Render، وهي نمذجة ثلاثية الأبعاد بدون نسيج: يحدد صانع المحتوى مسارات الكاميرا ومواقع الشخصيات وزوايا التصوير، ثم يكسو النموذج الهيكل بألوان وإضاءة واقعية، بما يشمل اتجاه مصدر الضوء ودرجة الحرارة اللونية والظلال كما يشرح فريق Seed.

كما يتيح النموذج تحريراً بمستوى الطابع الزمني، أي التحكم بالسرد والكاميرا والحركة والإيقاع لفترات زمنية محددة، مع إمكانية إجراء تعديلات مستهدفة بعد التوليد مع الحفاظ على الاستمرارية. وتشمل أدوات التحرير المتقدمة أيضاً الشاشة الخضراء مع محاكاة استجابة الجسم للبيئة الجديدة، من اتجاه الملابس والشعر وإيقاع المشي إلى الإضاءة، إضافة إلى تعديل زاوية الكاميرا والتحرير بالاستناد إلى مرجع.
وتستهدف بايت دانس استخدامات صناعية أبعد من المحتوى الإبداعي، من التعليم عبر «Doubao Classroom» إلى التصنيع والذكاء المجسّد والقيادة الذاتية، عبر توليد بيانات فيديو اصطناعية لتدريب الروبوتات ومحاكاة السيناريوهات طويلة الذيل. ومع ذلك، يعترف الفريق رسمياً بأن الفيزياء في الحركات المعقدة وثبات المشاهد متعددة الشخصيات ما زالت بحاجة إلى تحسين.
أسعار API: كم يكلف إنتاج فيديو بالذكاء الاصطناعي؟
لم ينشر الإعلان الرسمي أسعاراً شاملة، لكن وثائق BytePlus ModelArk المنشورة عبر مصادر متخصصة تحدد الأسعار بالتوكنات وليس بالثانية: 10.70 دولار لكل مليون توكن للطلبات بدون فيديو مدخل، و6.40 دولار لكل مليون توكن للطلبات مع فيديو مدخل، بجودة 480p و720p فقط.
وتعطي الأمثلة المنشورة تكلفة مقطع 5 ثوانٍ (16:9، 24 إطاراً في الثانية، بدون فيديو مدخل) بنحو 0.514 دولار بدقة 480p و1.156 دولار بدقة 720p، ما يعني تقديرياً أن مقطع 30 ثانية يكلف نحو 3.09 دولار بدقة 480p و6.93 دولار بدقة 720p. وتُحتسب التوليدات الناجحة فقط، إذ لا تُفوتر المحاولات الفاشلة مثل حالات رفض الرقابة.
ومن المهم الانتباه إلى أن نشر بطاقة الأسعار لا يعني توفر الوصول العام لكل الحسابات والمناطق بعد، إذ لا يزال الإعلان الرسمي يشير إلى أن الـ API «قادم قريباً». كما أن الدقة القصوى الرسمية للنموذج غير مذكورة في الإعلان، وتتباين المصادر حولها بين 4K وبين 480p/720p الواردة في بطاقة الأسعار.
ماذا يعني هذا لصنّاع المحتوى العرب؟
بالنسبة لصنّاع المحتوى في المنطقة، يغيّر هذا النوع من الأدوات معادلة الإنتاج في ثلاثة مجالات: إعلانات تتطلب مشاهد متسقة مع هوية العلامة، ودراما قصيرة تعتمد على الاستمرارية بين الحلقات، ومحتوى سوشيال ميديا يحتاج إنتاجاً سريعاً. فمقطع 30 ثانية كامل بالصوت في تمريرة واحدة يختصر مراحل ما بعد الإنتاج، والمرجعية المتعددة تحافظ على ثبات الشخصية عبر الجولات، والتحرير بمستوى الطابع الزمني يسمح بتعديل لقطة واحدة دون إعادة توليد المشهد كاملاً.
وفي سوق توليد الفيديو بالذكاء الاصطناعي، تقدم Veo 3.1 من Google مقاطع من 4 إلى 8 ثوانٍ مع حتى 3 صور مرجعية، بينما يقدم Kling 3.0 من Kuaishou دقة 4K بمعدل 60 إطاراً في الثانية، وتقدر تحليلات السوق سعره بنحو 20 دولاراً للدقيقة. أما سورا 2، فقد خرجت من السباق فعلياً مع إيقاف OpenAI لواجهتها.
لكن الحذر مطلوب عند الاستخدام التجاري؛ فسابقه سيدانس 2.0 الذي أُطلق في فبراير 2026 وأحدث ضجة عالمية بمقاطع واقعية لشخصيات مشهورة، تلقّت بايت دانس بسببه خطابات «وقف وكف» من ديزني وباراماونت، وفتحت اليابان تحقيقاً حول حقوق النشر، قبل أن تعلن الشركة تعزيز الضمانات، كما وثّقته BBC عربي.
الخطوة التالية المرتقبة هي فتح الـ API عبر BytePlus ModelArk، وما سيكشفه ذلك من أسعار فعلية وتوفر في الأسواق خارج الصين، وهو ما سيرسم الصورة الكاملة لتكلفة إنتاج الفيديو بالذكاء الاصطناعي في المنطقة العربية.










0 تعليقات
لا توجد تعليقات بعد