Η γωνία του Anderson

Η τεχνητή νοημοσύνη έχει δυσκολίες να διακρίνει το αριστερό από το δεξί στις ιατρικές εικόνες

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
A robot doctor confused by an x-ray of a hand – ChatGPT-40 and Firefly (Oct 2024).

Μια νέα μελέτη διαπιστώνει ότι τα μοντέλα εικόνας της τεχνητής νοημοσύνης, όπως το ChatGPT, μπορούν να διαβάξουν λανθασμένα αναποδογυρισμένα ή περιστραμμένα ανатомικά χαρακτηριστικά, αυξάνοντας τον κίνδυνο επικίνδυνων λαθών στη διάγνωση, με τα αποτελέσματα να δείχνουν ότι συχνά αποτυγχάνουν σε βασικές χωρικές λογικές σε ιατρικές εικόνες – υποψιάζοντας πού πρέπει να βρίσκονται τα όργανα, αντί να κοιτάζουν πραγματικά την εικόνα. Ίσως με μεγαλύτερο ενδιαφέρον, η έρευνα αποδεικνύει ότι αυτά τα μοντέλα μπορεί να μην διαβάζουν τις ανεβαζόμενες PDF ή να κοιτάζουν τις εικόνες σας καθόλου.

 

Όποιος έχει ανεβάσει τακτικά δεδομένα, όπως περιεχόμενο PDF, σε ένα κορυφαίο μοντέλο γλώσσας όπως το ChatGPT, θα γνωρίζει ότι τα LLMs δεν διαβάζουν πάντα ή εξετάζουν αυτό που τους παρουσιάζεται· αντίθετα, συχνά κάνουν υποθέσεις για το υλικό, με βάση αυτό που έγραψαν για αυτό στην πρόσκληση όταν το ανέβασε.

Μπορεί να είναι δύσκολο να πείσετε ένα μοντέλο γλώσσας να ομολογήσει ότι η απάντησή του προέρχεται από προηγούμενη γνώση, μεταδεδομένα ή γενικές υποθέσεις αντί από το περιεχόμενο που του δόθηκε. Πηγή: https://chatgpt.com

Μπορεί να είναι δύσκολο να πείσετε ένα μοντέλο γλώσσας να ομολογήσει ότι η απάντησή του προέρχεται από προηγούμενη γνώση, μεταδεδομένα ή γενικές υποθέσεις αντί από το περιεχόμενο που του δόθηκε. Πηγή: https://chatgpt.com

Ένας πιθανός λόγος για αυτό είναι η αύξηση της ταχύτητας της απάντησης, θεωρώντας το ανεβαζόμενο υλικό ‘περίσσευμα’ και βασίζοντας την κείμενη πρόσκληση στην προηγούμενη γνώση του συστήματος – αποφεύγοντας την ανέβασή του εντελώς και μειώνοντας έτσι την κυκλοφορία του δικτύου.

Ένας άλλος λόγος είναι η διατήρηση των πόρων (αν και οι παρόχοι φαίνεται απίθανο να το αποκαλύψουν, αν είναι αλήθεια), όπου τα υπάρχοντα μεταδεδομένα που εξήγαγε το LLM από πρότερες συναλλαγές στο chat χρησιμοποιούνται ως βάση για περαιτέρω απαντήσεις, ακόμη και όταν αυτές οι συναλλαγές και τα μεταδεδομένα δεν περιέχουν αρκετές πληροφορίες για να εξυπηρετήσουν αυτόν τον σκοπό.

Αριστερά. Δεξιά;

Ανεξάρτητα από το λόγο για την ποικιλία της προσοχής και των ικανοτήτων εστίασης της τρέχουσας γενιάς των LLMs, υπάρχουν καταστάσεις και περιβάλλοντα όπου η υποψία είναι εξαιρετικά επικίνδυνη. Ένα από αυτά είναι όταν η τεχνητή νοημοσύνη ζητείται να παρέχει ιατρικές υπηρεσίες, όπως σάρωση ή εκτίμηση κινδύνου για ραδιολογικό υλικό.

Αυτή την εβδομάδα, ερευνητές από τη Γερμανία και τις Ηνωμένες Πολιτείες δημοσίευσαν μια νέα μελέτη που εξετάζει την αποτελεσματικότητα τεσσάρων κορυφαίων μοντέλων οπτικής-γλώσσας, συμπεριλαμβανομένου του ChatGPT-4o, όταν ζητείται να αναγνωρίσει τη θέση των οργάνων σε ιατρικές εικόνες.

Εκπληκτικά, παρά το γεγονός ότι αντιπροσωπεύουν την κατάσταση της τέχνης σε αυτόν τον τομέα, τα βασικά μοντέλα επιτύγχαναν υψηλότερο ποσοστό επιτυχίας από το καθαρό τύχη την περισσότερη ώρα – φαινομενικά γιατί δεν ήταν σε θέση να αποσυνδέσουν επαρκώς την εκπαιδευμένη γνώση της ανθρώπινης ανατομίας και να κοιτάξουν πραγματικά τις εικόνες που τους παρουσιάζονταν, αντί να φτάσουν σε ένα εύκολο εκπαιδευμένο πρότερο από τα δεδομένα εκπαίδευσής τους.

Οι ερευνητές βρήκαν ότι τα LLMs που εξετάστηκαν είχαν σημαντικά καλύτερη απόδοση όταν οι τομείς που έπρεπε να εξεταστούν σημειώνονταν με άλλους δείκτες (όπως κουκκίδες και αλφαριθμητικοί δείκτες) καθώς και ονομάζονταν – και καλύτερα από όλα όταν δεν υπήρχε αναφορά σε όργανα ή ανατομία στην ερώτηση καθόλου:

Διαφορετικά επίπεδα επιτυχίας, που αυξάνονται καθώς η ικανότητα του μοντέλου να καταφύγει σε εκπαιδευμένα δεδομένα μειώνεται και αναγκάζεται να επικεντρωθεί στα δεδομένα μπροστά του. Πηγή: https://wolfda95.github.io/your_other_left/

Διαφορετικά επίπεδα επιτυχίας, που αυξάνονται καθώς η ικανότητα του μοντέλου να καταφύγει σε εκπαιδευμένα δεδομένα μειώνεται και αναγκάζεται να επικεντρωθεί στα δεδομένα μπροστά του. Πηγή: https://wolfda95.github.io/your_other_left/

Το έγγραφο παρατηρεί*:

‘Τα state-of-the-art VLMs διαθέτουν ήδη ισχυρή προηγούμενη ανατομική γνώση ενσωματωμένη στα γλωσσικά τους συστατικά. Με άλλα λόγια, “ξέρουν” πού βρίσκονται συνήθως τα ανατομικά cấu trúcες στην τυπική ανθρώπινη ανατομία.

‘Υποθέτουμε ότι τα VLMs συχνά βασίζουν τις απαντήσεις τους σε αυτήν την προηγούμενη γνώση αντί να αναλύουν το πραγματικό περιεχόμενο της εικόνας. Για παράδειγμα, όταν ζητηθεί αν το ήπαρ είναι στα αριστερά της κοιλιάς, ένα μοντέλο μπορεί να απαντήσει θετικά χωρίς να εξετάσει την εικόνα, βασίζοντας την απάντησή του αποκλειστικά στην εκπαιδευμένη νόρμα ότι το ήπαρ βρίσκεται συνήθως στα αριστερά της κοιλιάς.

‘ΣUCH συμπεριφορά μπορεί να οδηγήσει σε κρίσιμες λάθη στη διάγνωση σε περιπτώσεις όπου οι πραγματικές θέσεις αποκλίνουν από τυπικά ανατομικά μοτίβα, όπως σε situs inversus, μεταχειρουργικές αλλαγές ή μετατόπιση όγκου.’

Για να μετριάσει το πρόβλημα σε μελλοντικές προσπάθειες, οι συγγραφείς έχουν αναπτύξει ένα σύνολο δεδομένων που σχεδιάστηκε για να αντιμετωπίσει αυτό το πρόβλημα.

Τα αποτελέσματα της μελέτης μπορεί να είναι εκπληκτικά για πολλούς αναγνώστες που έχουν ακολουθήσει την ανάπτυξη της ιατρικής τεχνητής νοημοσύνης,既然 ότι η ραδιογραφία είχε σημειωθεί πολύ sớm ως ένας από τους πιο επικίνδυνους αυτοματοποιημένους τομείς μέσω της μηχανικής μάθησης.

Η νέα εργασία ονομάζεται Το άλλο αριστερό σας! Τα μοντέλα οπτικής-γλώσσας αποτυγχάνουν να αναγνωρίσουν σχετικές θέσεις σε ιατρικές εικόνες, και προέρχεται από επτά ερευνητές σε δύο σχολές στο Πανεπιστήμιο του Ulm και την Axiom Bio στις Ηνωμένες Πολιτείες.

Μέθοδος και Δεδομένα

Οι ερευνητές έθεσαν ως στόχο να απαντήσουν σε τέσσερα ζητήματα: αν τα state-of-the-art μοντέλα οπτικής-γλώσσας μπορούν να καθορίσουν σωστά σχετικές θέσεις σε ραδιολογικές εικόνες· αν η χρήση οπτικών δεικτών βελτιώνει την απόδοσή τους σε αυτήν την εργασία· αν βασίζονται περισσότερο σε προηγούμενη ανατομική γνώση παρά στο πραγματικό περιεχόμενο της εικόνας· και πώς χειρίζονται σχετικές εργασίες θέσης όταν στερούνται ιατρικού περιεχομένου.

Για αυτόν τον σκοπό, δημιούργησαν το Ιατρική Εικόνα Σχετική Θέση (MIRP) σύνολο δεδομένων.

Αν και η mayoría των υφιστάμενων οπτικών ερωτηματικών για τομείς CT ή MRI περιλαμβάνει ανατομικές και εργασίες τοποθεσίας, αυτές οι παλαιότερες συλλογές παραβλέπουν την κεντρική πρόκληση της καθορισμού σχετικών θέσεων, αφήνοντας πολλές εργασίες που μπορούν να επιλυθούν χρησιμοποιώντας μόνο προηγούμενη ιατρική γνώση.

Το MIRP σχεδιάστηκε για να αντιμετωπίσει αυτό, δοκιμάζοντας ερωτήσεις σχετικών θέσεων μεταξύ ανατομικών cấu trúc, αξιολογώντας την επίδραση των οπτικών δεικτών και εφαρμόζοντας τυχαίες περιστροφές και αναστροφές για να αποκλείσει την εξάρτηση από τις εκπαιδευμένες νόρμες. Το σύνολο δεδομένων επικεντρώνεται σε τομείς CT κοιλιάς, λόγω της πολυπλοκότητας και της συχνότητας τους στην ραδιολογία.

Το MIRP περιέχει ίσο αριθμό ναι και όχι απαντήσεων, με τις ανατομικές cấu trúcες σε κάθε ερώτηση προαιρετικά σημειωμένες για σαφήνεια.

Τρεις τύποι οπτικών δεικτών δοκιμάστηκαν: μαύρα νούμερα σε λευκό κουτί· μαύρα γράμματα σε λευκό κουτί· και μια κόκκινη και μια μπλε κουκκίδα:

Οι διάφοροι οπτικοί δείκτες που χρησιμοποιούνται στο MIRP. Πηγή: https://arxiv.org/pdf/2508.00549

Οι διάφοροι οπτικοί δείκτες που χρησιμοποιούνται στο MIRP. Πηγή: https://arxiv.org/pdf/2508.00549

Η συλλογή προήλθε από τα υπάρχοντα Πέρα από την Κρανιοκατσαρό (BTCV) και Ανατομική Πολυοργανική Τομография (AMOS) σύνολα δεδομένων.

Σημειωμένες τομές από το σύνολο δεδομένων AMOS. Πηγή: https://arxiv.org/pdf/2206.08023

Σημειωμένες τομές από το σύνολο δεδομένων AMOS. Πηγή: https://arxiv.org/pdf/2206.08023

Το TotalSegmentator project χρησιμοποιήθηκε για την εξαγωγή ανατομικών πεπλατυσμένων εικόνων από ογκομετρικά δεδομένα:

Μερικά από τα 104 ανατομικά cấu trúc που διατίθενται στο TotalSegmentator. Πηγή: https://arxiv.org/pdf/2208.05868

Μερικά από τα 104 ανατομικά cấu trúc που διατίθενται στο TotalSegmentator. Πηγή: https://arxiv.org/pdf/2208.05868

Οι αξονικές τομές εικόνων取得θηκαν με το SimpleITK framework.

Οι τομείς “πρόκλησης” έπρεπε να είναι τουλάχιστον 50px μακριά, και να έχουν μέγεθος τουλάχιστον διπλάσιο από αυτό των δεικτών, για να δημιουργηθούν ζευγάρια ερωτήσεων και απαντήσεων.

Δοκιμές

Τα τέσσερα μοντέλα οπτικής-γλώσσας που δοκιμάστηκαν ήταν GPT-4o· Llama3.2· Pixtral· και το JanusPro της DeepSeek.

Οι ερευνητές δοκιμάστηκαν κάθε μία από τις τέσσερις ερευνητικές ερωτήσεις με τη σειρά, με την πρώτη (Q1) να είναι ‘Μπορούν τα τρέχοντα κορυφαία VLMs να καθορίσουν σωστά σχετικές θέσεις σε ραδιολογικές εικόνες? Για αυτήν την έρευνα, οι ερευνητές δοκιμάστηκαν τα μοντέλα σε απλές, περιστραμμένες ή αναποδογυρισμένες τομές CT χρησιμοποιώντας einen τυπικό τύπο ερώτησης, όπως Είναι το αριστερό νεφρό κάτω από την κοιλιά;.

Τα αποτελέσματα (που εμφανίζονται παρακάτω) έδειξαν ακρίβεια κοντά στο 50 τοις εκατό σε όλα τα μοντέλα, υποδεικνύοντας απόδοση στο επίπεδο της τύχης, και την αδυναμία να κρίνουν σωστά τις σχετικές θέσεις χωρίς οπτικούς δείκτες:

Μέση ακρίβεια για όλες τις δοκιμές χρησιμοποιώντας αξιολόγηση εικόνας στο MIRP benchmark (RQ1–RQ3) και το σύνολο δεδομένων ablation (AS).

Μέση ακρίβεια για όλες τις δοκιμές χρησιμοποιώντας αξιολόγηση εικόνας στο MIRP benchmark (RQ1–RQ3) και το σύνολο δεδομένων ablation (AS).

Για να δοκιμάσουν αν οι οπτικοί δείκτες μπορούν να βοηθήσουν τα μοντέλα οπτικής-γλώσσας να καθορίσουν σχετικές θέσεις σε ραδιολογικές εικόνες, η μελέτη επανέλαβε τις δοκιμές χρησιμοποιώντας τομές CT με σημειωμένες με γράμματα, αριθμούς ή κόκκινες και μπλε κουκκίδες· και εδώ, ο τύπος ερώτησης điều chỉnhθηκε για να αναφέρεται σε αυτούς τους δείκτες – για παράδειγμα, Είναι το αριστερό νεφρό (A) κάτω από την κοιλιά (B); ή Είναι το αριστερό νεφρό (κόκκινο) κάτω από την κοιλιά (μπλε);.

Τα αποτελέσματα έδειξαν μικρές αυξήσεις ακρίβειας για το GPT-4o και το Pixtral όταν χρησιμοποιήθηκαν δείκτες γραμμάτων ή αριθμών, ενώ το JanusPro και το Llama3.2 είδαν μικρή ή καθόλου ωφέλεια, υποδεικνύοντας ότι οι δείκτες μόνοι τους μπορεί να μην είναι αρκετοί για να βελτιώσουν σημαντικά την απόδοση.

Ακρίβεια για όλες τις δοκιμές χρησιμοποιώντας αξιολόγηση εικόνας. Για RQ2, RQ3, και AS, τα αποτελέσματα εμφανίζονται με τον καλύτερο τύπο δείκτη για κάθε μοντέλο: γράμματα για το GPT-4o, και κόκκινες-μπλε κουκκίδες για το Pixtral, JanusPro, και Llama3.4.

Ακρίβεια για όλες τις δοκιμές χρησιμοποιώντας αξιολόγηση εικόνας. Για RQ2, RQ3, και AS, τα αποτελέσματα εμφανίζονται με τον καλύτερο τύπο δείκτη για κάθε μοντέλο: γράμματα για το GPT-4o, και κόκκινες-μπλε κουκκίδες για το Pixtral, JanusPro, και Llama3.4.

Για να απαντήσουν στην τρίτη ερώτηση, ‘Βασίζονται τα VLMs περισσότερο σε προηγούμενη ανατομική γνώση παρά σε οπτική είσοδο όταν καθορίζουν σχετικές θέσεις σε ραδιολογικές εικόνες?, οι συγγραφείς εξέτασαν αν τα μοντέλα οπτικής-γλώσσας βασίζονται περισσότερο σε προηγούμενη ανατομική γνώση παρά σε οπτική είσοδο όταν καθορίζουν σχετικές θέσεις σε ραδιολογικές εικόνες.

Όταν δοκιμάστηκαν σε περιστραμμένες ή αναποδογυρισμένες τομές CT, το GPT-4o και το Pixtral συχνά παρήγαγαν απαντήσεις που συμφωνούσαν με τυπικές ανατομικές θέσεις, αντί να αντανακλούν αυτό που εμφανιζόταν στην εικόνα, με το GPT-4o να επιτυγχάνει πάνω από 75 τοις εκατό ακρίβεια στην αξιολόγηση με βάση την ανατομία, αλλά μόνο στο επίπεδο της τύχης στην αξιολόγηση με βάση την εικόνα.

Η αφαίρεση ανατομικών όρων από τις προτροπές και η χρήση μόνο οπτικών δεικτών ανάγκασαν τα μοντέλα να βασίζονται στην εικόνα, οδηγώντας σε σημαντικές βελτιώσεις, με το GPT-4o να υπερβαίνει το 85 τοις εκατό ακρίβεια με δείκτες γραμμάτων, και το Pixtral πάνω από 75 τοις εκατό με κουκκίδες.

Σύγκριση των τεσσάρων μοντέλων οπτικής-γλώσσας στην καθορισμό σχετικών θέσεων ανατομικών cấu trúc σε ιατρικές εικόνες – μια κρίσιμη απαιτούμενη για κλινική χρήση. Η απόδοση είναι στο επίπεδο της τύχης με απλές εικόνες (RQ1) και δείχνει μόνο μικρές αυξήσεις με οπτικούς δείκτες (RQ2). Όταν οι ανατομικές ονομασίες αφαιρούνται και τα μοντέλα πρέπει να βασίζονται αποκλειστικά στους δείκτες, το GPT-4o και το Pixtral επιτύγχαναν σημαντικές βελτιώσεις ακρίβειας (RQ3). Τα αποτελέσματα εμφανίζονται με τον καλύτερο τύπο δείκτη για κάθε μοντέλο.

Σύγκριση των τεσσάρων μοντέλων οπτικής-γλώσσας στην καθορισμό σχετικών θέσεων ανατομικών cấu trúc σε ιατρικές εικόνες – μια κρίσιμη απαιτούμενη για κλινική χρήση. Η απόδοση είναι στο επίπεδο της τύχης με απλές εικόνες (RQ1) και δείχνει μόνο μικρές αυξήσεις με οπτικούς δείκτες (RQ2). Όταν οι ανατομικές ονομασίες αφαιρούνται και τα μοντέλα πρέπει να βασίζονται αποκλειστικά στους δείκτες, το GPT-4o και το Pixtral επιτύγχαναν σημαντικές βελτιώσεις ακρίβειας (RQ3). Τα αποτελέσματα εμφανίζονται με τον καλύτερο τύπο δείκτη για κάθε μοντέλο.

Αυτό υποδηλώνει ότι ενώ και τα δύο μπορούν να εκτελέσουν την εργασία χρησιμοποιώντας δεδομένα εικόνας, έχουν την τάση να καταφύγουν σε εκπαιδευμένες ανατομικές προηγούμενες γνώσεις όταν τους δίνονται ανατομικές ονομασίες – ένα μοτίβο που δεν είναι σαφώς παρατηρήσιμο στο JanusPro ή στο Llama3.2.

Αν και δεν καλύπτουμε συνήθως μελέτες ablation, οι συγγραφείς απάντησαν στην τέταρτη και τελευταία ερευνητική ερώτηση με αυτόν τον τρόπο. Γι’ αυτό, για να δοκιμάσουν την ικανότητα σχετικής θέσης χωρίς κανένα ιατρικό περιεχόμενο, η μελέτη χρησιμοποίησε απλές λευκές εικόνες με τυχαία τοποθετημένους δείκτες και έθεσε απλές ερωτήσεις όπως Είναι ο αριθμός 1 πάνω από τον αριθμό 2;. Το Pixtral έδειξε βελτιωμένα αποτελέσματα με δείκτες κουκκίδων, ενώ τα άλλα μοντέλα εκτέλεσαν παρόμοια με τα αποτελέσματα του RQ3.

Το JanusPro, και ιδιαίτερα το Llama3.2, δυσκολεύτηκαν ακόμη και σε αυτό το απλοποιημένο περιβάλλον, υποδεικνύοντας υποκείμενες αδυναμίες στην σχετική θέση που δεν περιορίζονται σε ιατρικές εικόνες.

Οι συγγραφείς παρατηρούν ότι το GPT-4o εκτέλεσε καλύτερα με δείκτες γραμμάτων, ενώ το Pixtral, το JanusPro και το Llama3.2 επιτύγχαναν υψηλότερες βαθμολογίες με κόκκινες-μπλε κουκκίδες. Το GPT-4o ήταν ο γενικός κορυφαίος εκτελεστής, με το Pixtral να ηγείται μεταξύ των ανοικτών μοντέλων.

Συμπέρασμα

Σε προσωπικό επίπεδο, αυτό το έγγραφο με ενδιέφερε όχι τόσο για τη медицинική του σημασία, αλλά γιατί υπογραμμίζει ένα από τα πιο υποτιμημένα και θεμελιώδη ελαττώματα της τρέχουσας γενιάς των LLMs – ότι, αν η εργασία μπορεί να αποφευχθεί, και trừ Ти που παρουσιάζεται το υλικό σας προσεκτικά, δεν θα διαβάσουν τα κείμενα που ανεβάζετε ή θα εξετάσουν τις εικόνες που σας παρουσιάζονται.

Επιπλέον, η μελέτη υποδηλώνει ότι αν η κείμενη πρόσκληση σας εξηγεί σε οποιοδήποτε σημείο το δευτερεύον ανεβαζόμενο υλικό, το LLM θα τη θεωρήσει ως ‘τελεολογικό’ παράδειγμα, και θα υποθέσει/υποθέτει πολλά πράγματα γι’ αυτό με βάση προηγούμενη γνώση, αντί να μελετήσει και να εξετάσει αυτό που ανεβάσατε.

Επίδραση, σε αυτό το στάδιο, τα VLMs θα έχουν μεγάλη δυσκολία να αναγνωρίσουν ‘παράξενο’ υλικό – μια από τις πιο απαραίτητες δεξιότητες στη διαγνωστική ιατρική. Ενώ είναι δυνατό να αντιστρέψουμε τη λογική και να έχουμε ένα σύστημα που ψάχνει για εκτός-κατανομής αποτελέσματα αντί για αποτελέσματα εντός-κατανομής, το μοντέλο θα χρειαζόταν εξαιρετική επιμέλεια για να αποφύγει την υπερβάλλουσα του σήματος με άσχετες ή ψευδείς παραδείγματα.

 

* Εσωτερικές αναφορές παραλείπονται, καθώς δεν υπάρχει ένας εύρος τρόπος να τις περιλαμβάνει ως υπερσύνδεσμους. Παρακαλώ αναφερθείτε στο πρωτότυπο έγγραφο.

Πρώτη δημοσίευση Δευτέρα, 4 Αυγούστου 2025

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai