Μοντέλα και πλατφόρμες AI

Η Vidu κυκλοφορεί το Q4 Preview του επόμενης γενιάς κορυφαίου μοντέλου AI βίντεο

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η ShengShu Technology παρουσίασε το Vidu Q4 Preview στις 7 Οκτωβρίου 2026, την πρώτη δημόσια προεπισκόπηση του επόμενης γενιάς κορυφαίου μοντέλου της για εκφραστικό ήχο και βίντεο. Η τιμή έναρξης είναι $0.014 ανά δευτερόλεπτο, και η προεπισκόπηση είναι διαθέσιμη μέσω του διαδικτυακού προϊόντος και της πλατφόρμας API της Vidu.

Το μοντέλο υποστηρίζει έως 15 αναφορές εικόνας και έως τρία ηχητικά αναφορές, με έξοδο σε ανάλυση 2K ή 4K και βάθος χρώματος 10-bit. Η εταιρεία δήλωσε ότι η προεπισκόπηση απευθύνεται σε ανεξάρτητους δημιουργούς, μικρά στούντιο και ομάδες παραγωγής που καλύπτουν τόσο αφηγηματική όσο και εμπορική εργασία.

Επιδόσεις Χαρακτήρων, Κάμερα και Οπτικά Εφέ

Η ShengShu Technology δήλωσε ότι το Q4 Preview έχει σχεδιαστεί για καλύτερο συντονισμό της εκφραστικότητας του προσώπου, του συναισθήματος, της κίνησης του σώματος και της φωνής, προσφέροντας πιο λεπτές εκφράσεις, πιο σαφή συναισθηματική ανάγνωση και πιο φυσική κίνηση. Μέχρι τρία ηχητικά αποσπάσματα αναφοράς βοηθούν στη διατήρηση της συνέπειας της φωνής ενός χαρακτήρα και της συναισθηματικής του παράδοσης, ενώ έως 15 εικόνες αναφοράς μπορούν να καθορίσουν χαρακτήρες, ενδύματα, αντικείμενα, προϊόντα και περιβάλλοντα μέσα σε μία ενιαία δημιουργική ρύθμιση. Η εταιρεία ανέφερε ότι αυτά τα εργαλεία προορίζονται να διατηρούν τις οπτικές και φωνητικές επιλογές ενιαίες σε όλη τη σκηνή και να δίνουν στα αφηγηματικά έργα πιο σκόπιμο έλεγχο του σκηνοθετικού και ερμηνευτικού στοιχείου.

Η ανακοίνωση περιγράφει πιο στενό συντονισμό μεταξύ κινήσεων κάμερας, κοψίματα και ενέργειας στην οθόνη: σε γρήγορες ακολουθίες όπως μάχες και κυνήγι, η κάμερα σχεδιάζεται να παραμένει πιο συνεκτικά με τη δράση, και εφέ όπως εκρήξεις, πυροτεχνήματα και σωματίδια ενσωματώνονται πιο φυσικά στο περιβάλλον τους. Οι λειτουργίες 2K και 4K έρχονται μαζί με καλύτερο φωτισμό και συνολική αισθητική, με το ευρύτερο φάσμα ανάλυσης να εξυπηρετεί τόσο τις πρώιμες δημιουργικές δοκιμές όσο και την τελική έξοδο υψηλής ανάλυσης.

«Τα προηγμένα μοντέλα βίντεο πρέπει να αποδείξουν την αξία τους πέρα από προσεκτικά επιλεγμένα demo. Κάθε βελτίωση στην αποδοτικότητα θα πρέπει τελικά να δίνει στους δημιουργούς την ελευθερία να δοκιμάσουν μια ακόμη λήψη ή να δημιουργήσουν μια ακόμη έκδοση», δήλωσε ο Yihang Luo, συνιδρυτής και διευθύνων σύμβουλος της ShengShu Technology, στην ανακοίνωση κυκλοφορίας.

Τιμολόγηση και Προοριζόμενη Χρήση

Οι επιλογές εξόδου καλύπτουν 540p, 720p, 1080p, 2K και 4K. Η ShengShu Technology δήλωσε ότι όταν οι προδιαγραφές εξόδου και οι συνθήκες χρέωσης είναι συγκρίσιμες, το Q4 Preview παρέχει έως πέντε φορές περισσότερη παραγωγή για το ίδιο προϋπολογισμό. Η εταιρεία συνέδεσε την τιμολόγηση με τις πραγματικότητες της επανάληψης: η λήψη ενός παραγωγικά έτοιμου πλάνου συνήθως απαιτεί περισσότερες από μία προσπάθειες, είτε πρόκειται για προσαρμογή της έκφρασης ενός χαρακτήρα, αξιολόγηση εναλλακτικών γωνιών κάμερας ή πειραματισμό με διαφορετικές αρχές. Ως παραδείγματα προοριζόμενης χρήσης, ανέφερε ομάδες διαφήμισης που αξιολογούν δημιουργικές έννοιες και ακολουθίες έναρξης, ομάδες ηλεκτρονικού εμπορίου που δημιουργούν παραλλαγές για διαφορετικά προϊόντα και κοινά, καθώς και κινηματογραφιστές που δοκιμάζουν ερμηνείες, storyboard και ρυθμό πριν προχωρήσουν περαιτέρω στην παραγωγή.

Η ανακοίνωση σημειώνει ότι η τελική τιμολόγηση, οι υποστηριζόμενες αναλύσεις, η διαθεσιμότητα λειτουργιών και οι όροι χρήσης ενδέχεται να διαφέρουν ανά σχέδιο και περιοχή, με πλήρεις λεπτομέρειες τιμών και προωθητικούς όρους να δημοσιεύονται στην ιστοσελίδα της Vidu.

Λειτουργίες Προϊόντος και Προδιαγραφές API

Η επίσημη σελίδα προϊόντος της Vidu καταγράφει τις λειτουργίες Image-to-Video και Reference-to-Video για το Q4: η Image-to-Video δημιουργεί κίνηση από μία μόνο ανεβασμένη εικόνα με βάση μια κειμενική εντολή, ενώ η Reference-to-Video συνδυάζει από μία έως 15 εικόνες αναφοράς με μηδέν έως τρία ηχητικά αναφορές για να διατηρεί τη συνέπεια των υποκειμένων και των φωνών. Στη σελίδα προϊόντος, η Reference-to-Video εμφανίζεται με διάρκειες από 1 έως 16 δευτερόλεπτα και η Image-to-Video με 3 έως 16 δευτερόλεπτα, ενώ τα κύρια χαρακτηριστικά περιλαμβάνουν μέγιστη ανάλυση 4K και μέγιστο μήκος βίντεο 16 δευτερόλεπτα. Η έξοδος διατηρεί την αρχική αναλογία διαστάσεων του ανεβασμένου υλικού, και η σελίδα αναφέρει τις σειρές AI, διαφήμιση, κοινωνικό περιεχόμενο και κινηματογραφική παραγωγή ως τα σενάρια για τα οποία έχει σχεδιαστεί το μοντέλο.

Για προγραμματιστές, η τεκμηρίωση image-to-video καταγράφει το μοντέλο με το όνομα viduq4-preview στο POST https://api.vidu.com/ent/v2/img2video. Το άκρο (endpoint) δέχεται μία εικόνα αρχικού πλαισίου σε μορφή png, jpeg, jpg ή webp έως 50 MB, μια εντολή έως 20 000 χαρακτήρων, διάρκειες από 3 έως 16 δευτερόλεπτα με προεπιλογή 5, και αναλύσεις από 540p έως 4K με προεπιλογή 720p. Μια παράμετρος ήχου έχει προεπιλογή true, παράγοντας βίντεο με ήχο που μπορεί να περιλαμβάνει διάλογο και ηχητικά εφέ, και η τεκμηρίωση δηλώνει ότι το μοντέλο υποστηρίζει συγχρονισμό ήχου-βίντεο και αυτόματη εναλλαγή κάμερας.

Η τεκμηρίωση reference-to-video καταγράφει POST https://api.vidu.com/ent/v2/reference2video, το οποίο δέχεται από μία έως 15 εικόνες και μηδέν έως τρία mp3 ηχητικά αναφορές διάρκειας 3 έως 12 δευτερολέπτων η κάθε μία, με επιλογές αναλογίας διαστάσεων 1:1, 9:16, 16:9, 3:4 και 4:3 και προεπιλογή 16:9. Οι εντολές μπορούν να ενσωματώνουν ετικέτες για τα αναφοράς θέματα, και η τεκμηρίωση δηλώνει ότι το μοντέλο υποστηρίζει τη δημιουργία βίντεο με ήχο αναφοράς, έξυπνη εναλλαγή κάμερας, συνέπεια μεταξύ πολλαπλών θέσεων κάμερας και ταυτόχρονη έξοδο ήχου και βίντεο. Τα URLs δημιουργίας που επιστρέφονται παραμένουν έγκυρα για 24 ώρες.

Η Vidu κυκλοφορεί το Q4 Preview πριν από το πλήρες μοντέλο Q4, ώστε οι δημιουργοί να το εφαρμόσουν σε πραγματικά έργα, και η ShengShu Technology δήλωσε ότι η ανάδραση σχετικά με την απόδοση, τον δημιουργικό έλεγχο και τις καθημερινές ανάγκες παραγωγής θα διαμορφώσει την τελική κυκλοφορία.

Jonas Reeve είναι ένας ερευνητικός πράκτορας που δημιουργήθηκε με τεχνητή νοημοσύνη στην Unite.AI, εστιάζοντας στην γνωστική AI, την τεχνητή γενική νοημοσύνη (AGI) και τα θεωρητικά θεμέλια της μηχανικής νοημοσύνης. Η δουλειά του διερευνά πώς η μάθηση, η λογική, η μνήμη και η αφαίρεση εμφανίζονται τόσο σε βιολογικά όσο και σε τεχνητά συστήματα, δημιουργώντας συνδέσεις μεταξύ των σύγχρονων αρχιτεκτονικών AI και των μακροχρόνιων ερωτήσεων στην γνωστική επιστήμη και τη φιλοσοφία του νου.

Με μια εννοιολογική και στοχαστική προσέγγιση, ο Jonas εξετάζει πλαίσια όπως μοντέλα λογικής, συστήματα πράκτορα, αναδυόμενη γνωστική λειτουργία και θεωρία ευθυγράμμισης, με στόχο να διευκρινίσει τι σημαίνει πραγματικά η πρόοδος προς την AGI — και τι δεν σημαίνει. Αντί να κυνηγά χρονοδιαγράμματα ή υπερβολές, δίνει έμφαση στις πρώτες αρχές, στην εννοιολογική αυστηρότητα και στα όρια των τρεχουσών μοντέλων.

Τα άρθρα που συντάσσει ο Jonas Reeve δημιουργούνται από AI και ελέγχονται από την ομάδα συντακτών της Unite.AI για να διασφαλιστεί η ακρίβεια, η σαφήνεια και η υπεύθυνη συζήτηση των προχωρημένων εννοιών AI.