Alibaba ने Wan 3.0 AI वीडियो जेनरेशन मॉडल लॉन्च किया है। यह PDF, PPT, फोटो, ऑडियो और टेक्स्ट जैसे इनपुट से 30 सेकेंड तक का वीडियो बना सकता है।
Alibaba ने Wan 3.0 AI मॉडल लॉन्च किया, जो 30 सेकेंड तक वीडियो बना सकता है
Photo Credit: AI Generated
AI वीडियो जेनरेशन के क्षेत्र में Alibaba ने बड़ा अपडेट दिया है। कंपनी ने अपने नए Wan 3.0 AI वीडियो जेनरेशन मॉडल को आधिकारिक तौर पर लॉन्च कर दिया है। यह मॉडल सिर्फ टेक्स्ट या तस्वीरों से वीडियो बनाने तक सीमित नहीं है, बल्कि टेक्स्ट, इमेज, ऑडियो, वीडियो के साथ PDF, PPT, डॉक्यूमेंट, स्प्रेडशीट और वेबपेज जैसी चीजों को भी इनपुट के तौर पर इस्तेमाल कर सकता है। इसकी सबसे बड़ी खासियत यह है कि Wan 3.0 एक बार में 30 सेकेंड तक का वीडियो तैयार कर सकता है।
Wan 3.0 की मदद से यूजर एक ही जेनरेशन में 30 सेकेंड तक का वीडियो बना सकते हैं। यह इसके पिछले मॉडल Wan 2.7 की 15 सेकेंड की सीमा से दोगुना है। Alibaba के मुताबिक, ज्यादा लंबी वीडियो अवधि की वजह से मॉडल को छोटे-छोटे क्लिप जोड़ने के बजाय एक ही वीडियो में ज्यादा पूरी कहानी दिखाने में मदद मिलती है।
मॉडल को खास तौर पर लंबे और ज्यादा कॉम्प्लेक्स वीडियो बनाने के लिए तैयार किया गया है। इसमें कैरेक्टर, सीन, कैमरा मूवमेंट, डायलॉग और ऑडियो को एक ही क्रिएटिव इनपुट के आधार पर मैनेज करने की क्षमता दी गई है।
Wan 3.0 का सबसे दिलचस्प फीचर इसका मल्टीमॉडल इनपुट सपोर्ट है। यूजर सिर्फ एक टेक्स्ट प्रॉम्प्ट देकर वीडियो बनाने के बजाय अलग-अलग तरह की फाइलों को रेफरेंस के तौर पर इस्तेमाल कर सकते हैं। इनमें PDF, PowerPoint प्रेजेंटेशन, Word डॉक्यूमेंट और Excel जैसी फाइलें भी शामिल हैं। इसके अलावा वेबपेज, इमेज, ऑडियो और मौजूदा वीडियो को भी रेफरेंस बनाया जा सकता है।
उदाहरण के लिए, किसी प्रोडक्ट की प्रेजेंटेशन या प्लानिंग डॉक्यूमेंट को इनपुट देकर उसके आधार पर प्रमोशनल वीडियो तैयार किया जा सकता है। इससे AI वीडियो जेनरेशन को सिर्फ क्रिएटिव एक्सपेरिमेंट के बजाय मार्केटिंग, प्रोडक्ट डेमो और दूसरे कामों में इस्तेमाल करने की संभावनाएं बढ़ती हैं।
Wan 3.0 में नेटिव ऑडियो-विजुअल जेनरेशन का सपोर्ट भी दिया गया है। यानी मॉडल सिर्फ वीडियो के विजुअल तैयार नहीं करता, बल्कि वीडियो के साथ ऑडियो और साउंड डिजाइन को भी जनरेट कर सकता है। Alibaba के मुताबिक इसका इस्तेमाल डायलॉग, बैकग्राउंड साउंड और दूसरे ऑडियो एलिमेंट्स के साथ वीडियो तैयार करने में किया जा सकता है।
मॉडल का एक और फोकस कैरेक्टर और ऑब्जेक्ट कंसिस्टेंसी पर है। कई AI वीडियो टूल्स में अलग-अलग फ्रेम में कैरेक्टर का चेहरा, कपड़े या प्रोडक्ट का डिजाइन बदलने की समस्या देखने को मिलती है। Wan 3.0 को रेफरेंस की डिटेल्स को अलग-अलग फ्रेम में ज्यादा सटीक तरीके से बनाए रखने के लिए तैयार किया गया है।
Wan 3.0 में 1080p तक वीडियो आउटपुट का सपोर्ट मिलता है। Alibaba Cloud Model Studio के मुताबिक, यूजर्स 480p, 720p और 1080p क्वालिटी में वीडियो जनरेट कर सकते हैं। API की कीमत वीडियो की अवधि और रिजॉल्यूशन के हिसाब से तय होती है। 480p आउटपुट के लिए कीमत $0.05 प्रति सेकेंड, 720p के लिए $0.10 और 1080p के लिए $0.20 प्रति सेकेंड से शुरू होती है।
हालांकि, Wan 3.0 को लेकर एक जरूरी बात यह है कि इसका API एक्सेस फिलहाल अप्रूवल के बाद उपलब्ध है और Alibaba Cloud इसे public preview के तौर पर पेश कर रहा है। यानी मॉडल की क्षमताएं उपलब्ध हैं, लेकिन API का इस्तेमाल हर यूजर के लिए तुरंत खुला नहीं है।
Wan 3.0 की लॉन्चिंग ऐसे समय हुई है जब AI कंपनियों के बीच वीडियो जेनरेशन को लेकर मुकाबला तेजी से बढ़ रहा है। Alibaba पहले से Wan सीरीज के जरिए इस क्षेत्र में काम कर रहा है और Wan 3.0 के साथ कंपनी ने वीडियो की लंबाई, इनपुट फॉर्मेट और ऑडियो-विजुअल जेनरेशन को एक ही सिस्टम में जोड़ने पर फोकस किया है।
लेटेस्ट टेक न्यूज़, स्मार्टफोन रिव्यू और लोकप्रिय मोबाइल पर मिलने वाले एक्सक्लूसिव ऑफर के लिए गैजेट्स 360 एंड्रॉयड ऐप डाउनलोड करें और हमें गूगल समाचार पर फॉलो करें।