Μοντέλα και πλατφόρμες AI

Πώς ένα εργαλείο AI για την υγεία του νου ανακάλυψε τυχαία την ακριβή ανίχνευση Deepfake

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Όπως η τεχνολογική εταιρεία Open AI έκδωσε το flagship μοντέλο βίντεο και ήχου Sora 2 τον Σεπτέμβριο του 2025, τα βίντεο deepfake έχουν κατακλύσει τις πλατφόρμες των κοινωνικών μέσων, καθιστώντας το κοινό ολοένα και πιο εξοικειωμένο με πιθανώς επικίνδυνες υπερ-ρεαλιστικές περιεχομένου.

Αν και η Open AI θεωρούσε την υπεύθυνη εκτόξευση του Sora 2 ως πρώτη προτεραιότητα, υποστηρίζοντας ότι θα δώσει στους χρήστες «τα εργαλεία και την επιλογικότητα να ελέγχουν τι βλέπουν στη διαδικτυακή τους ροή» και τον έλεγχο της ομοιόμορφης τους εικόνας, μια μελέτη του Οκτωβρίου 2025 βρήκε ότι το μοντέλο παρήγαγε ψευδείς διεκδικήσεις βίντεο το 80% του χρόνου.

Από βίντεο που μιμούνταν εκθέσεις ειδήσεων για einen εκλογικό υπάλληλο που καταστρέφει ψηφοδέλτια σε fabriqué σκηνές ενός μικρού παιδιού που συλλαμβάνεται από τις αρχές μετανάστευσης ή ενός εκπροσώπου της Coca-Cola που ανακοινώνει ότι η εταιρεία δεν θα χορηγήσει τον Σούπερ Μπόουλ, τα στοιχήματα για την παραγωγή ψευδών πληροφοριών σε έναν διασυνδεδεμένο κόσμο δεν θα μπορούσαν να είναι υψηλότερα.

Πέρα από το Sora: Vishing

Ακόμη και πριν από την εκτόξευση του εργαλείου της Open AI, η δημιουργία και διαδικτυακή διάδοση αρχείων deepfake ήταν σε άνοδο. Σύμφωνα με μια μελέτη του Σεπτεμβρίου 2025 από την εταιρεία κυβερνοασφάλειας DeepStrike, το περιεχόμενο deepfake αυξήθηκε από 500.000 το 2023 σε 8 εκατομμύρια το 2025, από τα οποία το μεγαλύτερο μέρος χρησιμοποιήθηκε για απάτες.

Η τάση δείχνει keine σημάδια σταματήματος. Η απάτη AI στις ΗΠΑ μόνο αναμένεται να φτάσει τα 40 δισεκατομμύρια δολάρια μέχρι το 2027.

Такой αύξηση δεν είναι περιορισμένη μόνο στην ποσότητα. Με εργαλεία όπως το Sora 2 και το Veo 3 της Google (GOOGL ), το περιεχόμενο των AI-γεννημένων προσώπων, φωνών και πλήρων επιδόσεων είναι τώρα πιο ρεαλιστικό από ποτέ. Όπως σημειώθηκε από τον επιστήμονα υπολογιστών και ερευνητή deepfake Siwei Lyu, τα σύγχρονα μοντέλα είναι ικανά να παράγουν σταθερά πρόσωπα χωρίς παραμορφώσεις ή διαστρεβλώσεις, ενώ η κλωνοποίηση φωνής έχει διασχίσει ένα «αδιακρίτως όριο».

Η αλήθεια είναι ότι τα deepfakes ξεπερνούν την ανίχνευση. Αυτό που οι εταιρείες τεχνολογίας πουλάνε ως διασκεδαστικά εργαλεία για τη δημιουργία mọiTHING από ολυμπιακές γυμναστικές ρουτίνες έως σύνθετα φωνητικά τοπία, έχει επίσης χρησιμοποιηθεί από εγκληματίες για να στοχεύσουν επιχειρήσεις και άτομα.

Μόνο στο πρώτο μισό του 2025, τα περιστατικά deepfake προκάλεσαν ζημιές 356 εκατομμυρίων δολαρίων για τις εταιρείες και 541 εκατομμύρια δολάρια για τα άτομα.

Η παραδοσιακή ανίχνευση deepfake – περιλαμβάνοντας την ανίχνευση watermarks, airbrushed προσώπων και ελέγχους μεταδεδομένων – αποτυγχάνει. Και, καθώς οι φωνητικές deepfakes παραμένουν η δεύτερη πιο συχνή μορφή απάτης AI και φωνητικής φωνητικής φωνητικής (vishing) αυξήθηκε 442% το 2025, οι συνέπειες ήδη felt.

«Μερικά δευτερόλεπτα ήχου αρκούν για να δημιουργηθεί ένα πειστικό κλώνο – πλήρης με φυσική προσωδία, ρυθμό, έμφαση, συναισθήματα, παύσεις και θορύβους αναπνοής», έγραψε ο Lyu.

Η Επιστήμη της Ακρόασης των Ανθρώπων

Kintsugi, μια εταιρεία υγείας που αναπτύσσει τεχνολογία βιοδεικτών φωνής AI για την ανίχνευση σημείων κλινικής κατάθλιψης και αγχώδους. Η δουλειά τους ξεκίνησε από μια φαινομενικά απλή υπόθεση: πρέπει να ακούσουμε τους ανθρώπους.

«Ξεκίνησα την Kintsugi λόγω ενός προβλήματος που έζησα προσωπικά. Πέρασα σχεδόν πέντε μήνες καλώντας τον πάροχο μου για να προγραμματίσω μια αρχική συνεδρίαση θεραπείας, και κανείς δεν με επανέφερε. Συνέχισα να προσπαθώ – αλλά θυμάμαι ότι σκεφτόμουν πολύ καθαρά ότι αν αυτό ήταν ο πατέρας μου ή ο αδερφός μου, θα είχαν σταματήσει πολύ πριν από μένα», είπε η CEO Grace Chang σε μια συνομιλία με το Unite.AI.

Η εταιρεία με έδρα την Καλιφόρνια ιδρύθηκε το 2019 ως λύση σε αυτό που ο Chang περιέγραψε ως «μποττίλνεκ τριών». Ο ιδρυτής πίστευε ότι η ανίχνευση της βαρύτητας νωρίτερα και παθητικά θα μπορούσε να βοηθήσει τους ανθρώπους να φτάσουν στο σωστό επίπεδο φροντίδας γρηγορότερα. Και, μέσω της Kintsugi Voice, οι βιοδεικτές φωνής αναγνωρίζουν την κλινική κατάθλιψη και αγχώδη.

Η έρευνα abounds αποδεικνύει την επιτυχημένη χρήση της AI-κίνησης ομιλίας και ανάλυσης φωνής ως βιοδείκτη για ψυχικές ασθένειες. Μια μελέτη του Μαΐου 2025, για παράδειγμα, βρήκε ότι οι ακουστικοί βιοδεικτές μπορούν να ανιχνεύσουν πρώιμα σημάδια ψυχικής υγείας και νευροδιαφορών, και υποστήριξε την ενσωμάτωση των αναλύσεων τραγουδιών σε κλινικές ρυθμίσεις για την αξιολόγηση της πιθανής γνωστικής πτώσης των ασθενών.

Οι μετρήσεις φωνής, στην πραγματικότητα, έχουν einen ακρίβεια ρυθμού 78% έως 96% στην αναγνώριση ατόμων με κατάθλιψη έναντι εκείνων χωρίς, σύμφωνα με την Αμερικανική Ψυχιατρική Εταιρεία. Μια άλλη μελέτη χρησιμοποίησε einen one-minute λεκτικό τεστ σε οποίο ένας άνθρωπος ονόμασε όσο το δυνατόν περισσότερες λέξεις μέσα σε μια δεδομένη κατηγορία – βρήκε 70% έως 83% ακρίβεια στην ανίχνευση όταν ένα θέμα είχε και κατάθλιψη και αγχώδη.

Για να αξιολογήσουν την ψυχική υγεία των χρηστών τους, η Kintsugi ζητάει einen σύντομο clip ομιλίας, μετά το οποίο η τεχνολογία βιοδεικτών φωνής αναλύει τον τόνο, την προσωδία, την τονική και τις παύσεις – δείκτες βρίσκονται να σχετίζονται με καταστάσεις όπως κατάθλιψη, αγχώδη, διπολική διαταραχή και άνοια.

Τι δεν συνειδητοποίησε αρχικά η Chang, όμως, ήταν ότι η τεχνολογία είχε ξεκλειδώσει einen από τους πιο επίκαιρους σύγχρονους προκλήσεις της βιομηχανίας ασφαλείας: την ταυτοποίηση του τι κάνει τις ανθρώπινες φωνές ανθρώπινες.

Από την Περίθαλψη Ψυχικής Υγείας στην Κυβερνοασφάλεια

Κατά την παραμονή της σε einen σύνοδο στο Νέα Υόρκη στα τέλη του 2025, η Chang ανέφερε σε einen φίλο στην κυβερνοασφάλεια ότι η ομάδα της είχε πειραματιστεί με συνθετικές φωνές.

«Πειραματιζόμασταν με συνθετικά δεδομένα για να αυξήσουμε την εκπαίδευση για τα μοντέλα μας για την ψυχική υγεία, αλλά οι γεννημένες φωνές ήταν τόσο διαφορετικές από την αυθεντική ανθρώπινη ομιλία που μπορούσαμε να τις αναγνωρίσουμε σχεδόν 100% του χρόνου», είπε.

«Σταμάτησε και μου είπε, ‘Γκρέις – αυτό δεν είναι ένα λυμένο πρόβλημα στην ασφάλεια.’ Αυτή ήταν η στιγμή που όλα συνδέθηκαν. Από τότε, οι συνομιλίες με εταιρείες ασφαλείας, χρηματοοικονομικές υπηρεσίες και τηλεπικοινωνίες έχουν επιβεβαιώσει πόσο γρήγορα αυξάνονται οι επιθέσεις φωνής deepfake – και πόσο πραγματική είναι η ανάγκη να διακρίνουμε τις ανθρώπινες φωνές από τις συνθετικές φωνές σε ζωντανούς κλήσεις», πρόσθεσε η CEO.

Τον Απρίλιο του προηγούμενου χρόνου, το FBI είχε προειδοποιήσει για μια κακόβουλη εκστρατεία μηνυμάτων κειμένου και φωνής που παρουσιάζονταν ως επικοινωνίες από υψηλά ιστάμενους αξιωματούχους των ΗΠΑ και στόχευαν πρώην εργαζόμενους της κυβέρνησης και τους συνεργάτες τους. Οι μεγάλες εθνικές τράπεζες στις ΗΠΑ είχαν επίσης στοχευτεί με 5,5 μέσες ημερήσιες προσπάθειες απάτης φωνής, και το προσωπικό του νοσοκομείου Vanderbilt University Medical Center ανέφερε επιθέσεις vishing από απατεώνες που παρουσιάζονταν ως φίλοι, επόπτες και συνεργάτες.

Ανεξάρτητα, τα deepfakes δεν ήταν αρχικά μέρος της δουλειάς της Kintsugi. Ενώ η ομάδα της εταιρείας είχε χρησιμοποιήσει μοντέλα off-the-shelf όπως Cartesia, Sesame και ElevenLabs για να πειραματιστεί με συνθετικές φωνές για διαχειριστές κέντρων κλήσεων και εξερχόμενες ροές εργασίας, η απάτη deepfake δεν ήταν ο στόχος τους σε έναν πολυσύχναστο και προσβάσιμο αγορά με μοντέλα όπως το Sora.

Οι ανθρώπινες σηματοδοτήσεις που δείχνουν την αυθεντικότητα της φωνής, όμως, είναι οι ίδιοι βιοδεικτές που κάνουν έναν άνθρωπο άνθρωπο. Ανεξάρτητα από τη γλώσσα ή τη σημασιολογία, η Kintsugi Voice λειτουργεί με επεξεργασία σήματος και τη φυσική.latency της ομιλίας, καπνίζοντας τις λεπτές χρονικές, προσωδιακές μεταβλητότητες, γνωστική φόρτωση και φυσιολογικούς δείκτες που αντανακλούν πώς παράγεται η ομιλία… όχι τι λέει.

«Οι συνθετικές φωνές μπορούν να ακούγονται άνετες, αλλά δεν φέρουν τους ίδιους βιολογικούς και γνωστικούς αρτεφάκτα», είπε η Chang. Το μοντέλο της εταιρείας είναι συνεχώς ένας κορυφαίος εκτελεστής στην ακρίβεια ανίχνευσης, χρησιμοποιώντας όσο το 3 έως 5 δευτερόλεπτα ήχου.

Η Kintsugi μπορεί να είναι επαναστατική για εκείνους που πασχίζουν με την ψυχική υγεία, ιδιαίτερα σε περιοχές όπου η λήψη θεραπείας με επαγγελματίες χρειάζεται χρόνο και πόρους. Με την ίδια λογική, η τεχνολογία της προσφέρει μια επανάσταση για την ανίχνευση deepfake και την κυβερνοασφάλεια γενικότερα: ανίχνευση αυθεντικότητας αντί για αναγνώριση deepfake.

Το Μέλλον Βρίσκεται στην Ανθρώπινη Κεντρική Τεχνολογία

Η κυβερνοασφάλεια έχει επικεντρωθεί για πολύ καιρό στην κακόβουλη χρήση τεχνολογιών ή τους ίδιους τους δράστες. Η τυχαία ανακάλυψη της Kintsugi, όμως, στοιχηματίζει στην ανθρωπότητα herself.

«Λειτουργούμε σε έναν完全 διαφορετικό επιφάνεια: την αυθεντικότητα του ανθρώπου. Οι LLMs δεν μπορούν να ανιχνεύσουν με συνέπεια το περιεχόμενο που παράγουν οι LLMs, και οι μεθόδους που βασίζονται σε αρτεφάκτα είναι εύθραυστες. Η καπνίσματος μεγάλων, κλινικά ετικετεμένων συνόλων δεδομένων που κωδικοποιούν την πραγματική ανθρώπινη μεταβλητότητα είναι δαπανηρή, αργή και έξω από την πυρήνα εμπειρογνωμοσύνη των περισσότερων εταιρειών ασφαλείας — που καθιστά αυτήν την προσέγγιση δύσκολο να αναπαραχθεί», σημείωσε η Chang.

Η προσέγγιση της εταιρείας επίσης υποδηλώνει μια ευρύτερη μετατόπιση: καινοτομία διασταύρωσης. Αυτοί οι πρωτοπόροι στην υγεία μπορεί να οδηγήσουν την προώθηση της ανίχνευσης vishing με υποστήριξη AI, όπως και οι καινοτόμοι στην τεχνολογία διαστήματος θα μπορούσαν να υποστηρίξουν νέες μηχανισμούς έκτακτης ανάγκης, ή οι αρχιτέκτονες και οι urbanιστές θα μπορούσαν να υποστηρίξουν την αρχιτεκτονική και την πολεοδομία.

Όσον αφορά την Chang, σχεδιάζει να γίνει ένα πρότυπο για την επαλήθευση των πραγματικών ανθρώπων και, τελικά, πραγματικών προθέσεων μέσω φωνητικών αλληλεπιδράσεων.

«Όπως το HTTPS έγινε ένα προεπιλεγμένο επίπεδο ασφαλείας για το διαδίκτυο, πιστεύουμε ότι η «απόδειξη ανθρώπου» θα γίνει ένα θεμελιώδες επίπεδο για συστήματα που βασίζονται στη φωνή. Το Signal είναι η αρχή αυτής της υποδομής», είπε.

Όσο η γεννητική AI συνεχίζει να επιταχύνεται, τα πιο αποτελεσματικά μέτρα ασφαλείας μπορεί να προέρχονται από την κατανόηση του τι κάνει τους ανθρώπους… καλά, ανθρώπινους.

Η Salomé είναι μια δημοσιογράφος γεννημένη στο Medellín και Senior Reporter στο Espacio Media Incubator. Με υπόβαθρο στην Ιστορία και την Πολιτική, το έργο της Salomé τονίζει τη κοινωνική επικαιρότητα των αναδυόμενων τεχνολογιών. Έχει παρουσιαστεί στο Al Jazeera, Latin America Reports, και The Sociable, μεταξύ άλλων