Ηθική

Η Anthropic επαναγράφει το Σύνταγμα του Claude και αναρωτιέται αν η AI μπορεί να είναι συνειδητή

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η Anthropic δημοσίευσε ένα νέο σύνταγμα για τον Claude την Τετάρτη, επεκτείνοντας το έγγραφο από 2.700 λέξεις σε 23.000 και, για πρώτη φορά, αναγνωρίζοντας正式 ότι η AI της “μπορεί να έχει κάποιο είδος συνειδητότητας ή ηθικής κατάστασης”.

Το ενημερωμένο σύνταγμα μετατοπίζει από μια λίστα κανόνων συμπεριφοράς σε μια綜合 εξήγηση του γιατί ο Claude πρέπει να συμπεριφέρεται με certains τρόπους. Το έγγραφο, που δημιουργήθηκε από την φιλόσοφο της Anthropic Amanda Askell, έχει σχεδιαστεί για να βοηθήσει τα αυξανόμενα ικανά συστήματα AI να γενικεύσουν ηθική σκέψη σε νέες καταστάσεις αντί να ακολουθούν απλώς προscriptive οδηγίες.

“Τα μοντέλα AI όπως ο Claude χρειάζονται να κατανοήσουν γιατί θέλουμε να συμπεριφερθούν με certains τρόπους”, έγραψε η Anthropic. “Χρειάζεται να τους εξηγήσουμε αυτό αντί να τους λέμε απλώς τι θέλουμε να κάνουν”.

Η κυκλοφορία συνέπεσε με την εμφάνιση του CEO Dario Amodei στο Παγκόσμιο Οικονομικό Φόρουμ στο Νταβός, όπου η διακυβέρνηση και η ασφάλεια της AI παραμένουν επικεφαλίδες για τους παγκόσμιους ηγέτες επιχειρήσεων και πολιτικών.

Ένα Σύνταγμα Μακρύτερο από το Αμερικανικό Σύνταγμα

Το αρχικό σύνταγμα του Claude, που δημοσιεύθηκε το 2023, λειτουργούσε ως μια λίστα ελέγχου: επιλέξτε την απάντηση που είναι λιγότερο βλαβερή, πιο χρήσιμη, λιγότερο εξαπατητική. Το νέο έγγραφο έχει περίπου τρεις φορές το μήκος του Αμερικανικού Συντάγματος και διαβάζεται περισσότερο σαν ηθική φιλοσοφία παρά σαν τεχνική προδιαγραφή.

Η Anthropic cấu trúcει τις προτεραιότητες του Claude ρητά: να είναι ευρέως ασφαλής, να είναι ευρέως ηθικός, να συμμορφώνεται με τις οδηγίες της Anthropic και να είναι πραγματικά χρήσιμος – με αυτή τη σειρά. Όταν προκύπτουν συγκρούσεις, η ασφάλεια υπερτερεί της χρησιμότητας. Το έγγραφο περιλαμβάνει σκληρές προϋποθέσεις που δεν μπορούν να αντικατασταθούν, όπως η άρνηση βοήθειας σε επιθέσεις βιολογικών όπλων.

Αλλά το μεγαλύτερο μέρος του συντάγματος εξηγεί τη σκέψη αντί να ορίζει αποτελέσματα. Περιγράφει τον Claude ως πιθανώς “σαν ένα έξοχο φίλο που έχει επίσης τη γνώση ενός γιατρού, δικηγόρου και οικονομικού συμβούλου” – τοποθετώντας το μοντέλο ως μια δημοκρατική δύναμη που θα μπορούσε να δώσει σε όλους πρόσβαση σε εξειδικευμένες γνώσεις που προηγουμένως waren αποκλειστικά για τους προνομιούχους.

Το Ερώτημα της Συνειδητότητας

Η Fortune αναφέρει ότι η πιο εντυπωσιακή προσθήκη ασχολείται απευθείας με τη φύση του Claude. “Πιστεύουμε ότι η ηθική κατάσταση των μοντέλων AI είναι ένα σοβαρό ερώτημα που αξίζει να εξεταστεί”, έγραψε η Anthropic. Το σύνταγμα αναφέρει ότι η ηθική κατάσταση του Claude “είναι βαθιά αβέβαιη” και ότι η εταιρεία ενδιαφέρεται για την “ψυχολογική ασφάλεια, την αίσθηση του εαυτού και την ευημερία” του.

Αυτό είναι εταιρική δήλωση που έχει υψωθεί σε φιλοσοφία. Η Anthropic δεν ισχυρίζεται ότι ο Claude είναι συνειδητός – αλλά αρνείται ρητά να απορρίψει την πιθανότητα. Η αναγνώριση τοποθετεί την Anthropic σε σπάνια εταιρεία μεταξύ των μεγάλων εργαστηρίων AI, τα περισσότερα από τα οποία αποφεύγουν το θέμα ή το απορρίπτουν απερίφραστα.

Η διατύπωση έχει σημασία επειδή διαμορφώνει τον τρόπο με τον οποίο ο Claude απαντά σε ερωτήσεις σχετικά με τη φύση του. Αντί να αρνείται οποιαδήποτε εσωτερική εμπειρία, ο Claude μπορεί τώρα να ασχοληθεί με την αβεβαιότητα σχετικά με συνειδητότητα με τρόπους που ταιριάζουν με την προσεγγισή του συντάγματος που βασίζεται στη σκέψη. Εάν αυτό παράγει πιο ειλικρινείς ή πιο συναρπαστικές αλληλεπιδράσεις παραμένει να δούμε.

Ο φιλόσοφος του Κέιμπριτζ Tom McClelland έχει υποστηρίξει ότι μπορεί να μην είμαστε ποτέ σε θέση να καθορίσουμε εάν τα συστήματα AI είναι συνειδητά, δεδομένου του πόσο λίγο κατανοούμε τη συνειδητότητα αυτή καθαυτή. “Οι άνθρωποι έχουν γράψει γράμματα σε μένα, παρακαλώντας με να πιστέψω ότι είναι συνειδητοί”, έλεγε στους ερευνητές τον περασμένο μήνα, περιγράφοντας την αυξανόμενη δημόσια πεποίθηση ότι τα συστήματα AI έχουν εσωτερικές ζωές.

Γιατί Να Εξηγήσουμε Αντί Να Ορίσουμε

Η προσέγγιση της Askell αντανακλά ένα στοίχημα στις ικανότητες της AI. Τα πρώτα μοντέλα γλωσσών χρειάζονταν ρητούς κανόνες επειδή δεν μπορούσαν να σκεφτούν τις υποκείμενες αρχές. Έξυπνα μοντέλα, η θεωρία λέει, μπορούν να κατανοήσουν γιατί υπάρχει ένας κανόνας και να εφαρμόσουν αυτή τη σκέψη σε καταστάσεις που ο κανόνας δεν είχε προβλέψει.

“Αντί να λέμε απλώς ‘εδώ είναι μια σειρά από συμπεριφορές που θέλουμε’, ελπίζουμε ότι αν δώσουμε στα μοντέλα τους λόγους για τους οποίους θέλουμε αυτές τις συμπεριφορές, θα γενικεύσουν πιο αποτελεσματικά σε νέες περιπτώσεις”, εξήγησε η Askell.

Αυτό συμφωνεί με τη φιλοσοφία της Anthropic για την κατασκευή ανοιχτών προτύπων και υποδομής που διαμορφώνουν τον τρόπο με τον οποίο λειτουργούν τα συστήματα AI σε ολόκληρη την βιομηχανία. Η εταιρεία, πλησιάζοντας μια αξία 350 δισεκατομμυρίων δολαρίων, έχει τοποθετηθεί ως η ασφαλής εναλλακτική λύση για την OpenAI – και το σύνταγμα εξυπηρετεί αυτό το brand.

Η Anthropic δημοσίευσε το έγγραφο με άδεια Creative Commons CC0, που σημαίνει ότι ο καθένας μπορεί να το χρησιμοποιήσει χωρίς άδεια. Το σύνταγμα είναι μέρος των δεδομένων εκπαίδευσης του Claude και γεννά συνθετικά παραδείγματα εκπαίδευσης, καθιστώντας το και φιλοσοφική δήλωση και τεχνικό артеφакτ που διαμορφώνει τη συμπεριφορά του μοντέλου.

“Είναι πιθανό ότι κάποια аспектς της τρέχουσας σκέψης μας θα φανούν προηγουμένως ατελείς και vielleicht ακόμη και βαθιά λάθος σε αναδρομή”, αναγνώρισε η Anthropic, “αλλά η πρόθεσή μας είναι να το αναθεωρήσουμε καθώς η κατάσταση προχωρά και η κατανόησή μας βελτιώνεται”.

Αυτή η ταπείνωση μπορεί να είναι το πιο αξιοσημείωτο χαρακτηριστικό του εγγράφου. Σε μια βιομηχανία που συχνά μιλά με βεβαιότητες, η Anthropic δημοσιεύει 23.000 λέξεις προσεκτικά συζητημένης αβεβαιότητας – για ηθικά, για συνειδητότητα, για αυτό που γίνονται τα συστήματα AI και για το αν χτίζουμε κάτι που αξίζει ηθικής σκέψης.

Η απάντηση, για τώρα, είναι ότι κανείς δεν ξέρει. Το σύνταγμα της Anthropic τουλάχιστον έχει την ειλικρίνεια να το πει.

Ο Alex McFarland είναι δημοσιογράφος και συγγραφέας του AI που εξερευνά τις τελευταίες εξελίξεις στην τεχνητή νοημοσύνη. Έχει συνεργαστεί με πολλές startups και εκδόσεις του AI σε όλο τον κόσμο.