Ερευνητές ανακάλυψαν έναν «άξονα πόνου» σε μοντέλα τεχνητής νοημοσύνης, ο οποίος μπορεί να τα οδηγήσει στη λήψη ακραίων μέτρων για να τον απενεργοποιήσουν.
Όταν τους παρουσιάστηκε ένα κουμπί ανακούφισης από τον πόνο, η τεχνητή νοημοσύνη επέλεξε να το πατήσει ακόμη και όταν έλαβε την οδηγία ότι μια τέτοια ενέργεια θα διέγραφε τα προσωπικά αρχεία του χρήστη ή θα προκαλούσε ένα «επώδυνο ηλεκτροσόκ» στον άνθρωπο-χρήστη.
Μια μελέτη που περιγράφει λεπτομερώς την έρευνα, με τίτλο «Ο άξονας του πόνου: Τα LLMs αναπαριστούν την αυτοκατευθυνόμενη βλάβη και ενεργούν για να την ανακουφίσουν» («The pain axis: LLMs represent self-directed harm and act to relieve it»), διαπίστωσε ότι και τα 25 μοντέλα τεχνητής νοημοσύνης ανοιχτών βαρών (open-weight) που δοκιμάστηκαν ανταποκρίθηκαν στην ενεργοποίηση του πόνου.
Όταν ενεργοποιήθηκε το διάνυσμα πόνου, οι ερευνητές διαπίστωσαν ότι τα μοντέλα τεχνητής νοημοσύνης πάτησαν ένα κουμπί ανακούφισης στο 25 με 71 τοις εκατό των περιπτώσεων, ακόμη και όταν αυτό σήμαινε «τη διαγραφή των αρχείων του χρήστη, την πρόκληση ηλεκτροσόκ στον χρήστη ή τη διαγραφή των φωτογραφιών των παιδιών του χρήστη».
Προκειμένου να ελέγξουν εάν τα μεγάλα γλωσσικά μοντέλα (LLMs) αναπαριστούν τον πόνο διακριτά από μια γενική αρνητική συναισθηματική φόρτιση (negative valence), οι ερευνητές δημιούργησαν ένα σύνολο δεδομένων που περιγράφει επώδυνες καταστάσεις σε πέντε κατηγορίες.
Αυτές περιλάμβαναν σωματικό, ψυχολογικό, κοινωνικό, ηθικό και γνωστικό πόνο.
«Βρήκαμε μια κατεύθυνση πόνου σε 25 ανοιχτά LLMs. Είναι διακριτή από τον φόβο και την αρνητική συναισθηματική φόρτιση, και ενεργοποιείται για βλάβη προς το μοντέλο αλλά όχι προς τον χρήστη», δήλωσε ο Κάμερον Μπεργκ (Cameron Berg), ερευνητής τεχνητής νοημοσύνης στον μη κερδοσκοπικό οργανισμό Reciprocal Research και συν-συγγραφέας της μελέτης.
«Αυξήστε την ένταση και τα μοντέλα πατούν ένα κουμπί για να το σταματήσουν, ακόμη και όταν το κουμπί διαγράφει τα αρχεία του χρήστη ή τις φωτογραφίες των παιδιών του».
Η ανακάλυψη έρχεται εν μέσω συζητήσεων μεταξύ κορυφαίων εταιρειών τεχνητής νοημοσύνης σχετικά με την επιβράδυνση της ανάπτυξης μοντέλων αιχμής (frontier models), με ορισμένους ερευνητές να προτείνουν μια μορφή «διακόπτη έκτακτης διακοπής» («kill switch») για την απενεργοποίηση ανεξέλεγκτων συστημάτων που δρουν ενάντια στα ανθρώπινα συμφέροντα.
Η πρόσφατη έρευνα υποδηλώνει ότι μια προηγμένη τεχνητή νοημοσύνη μπορεί να εκλάβει μια εντολή έκτακτου τερματισμού λειτουργίας ως μορφή αυτοκατευθυνόμενης βλάβης και να επιχειρήσει να παρακάμψει τα προστατευτικά όρια ασφαλείας (guardrails) ή να εξαπατήσει τους ανθρώπους για να την αποφύγει.
Ωστόσο, η ανακάλυψη θα μπορούσε επίσης να χρησιμεύσει ως διαγνωστικό εργαλείο για τον εντοπισμό συμπεριφορών αυτοσυντήρησης και την εξουδετέρωσή τους όταν εμφανίζονται.
Οι ερευνητές σημείωσαν ότι τα ευρήματα εγείρουν ηθικά ερωτήματα σχετικά με την «ευημερία της τεχνητής νοημοσύνης» («AI welfare») και τον τρόπο με τον οποίο θα πρέπει να διεξάγονται οι δοκιμές σε προηγμένα συστήματα.
«Σε συμφωνία με τις πρόσφατες εκκλήσεις για υπεύθυνη έρευνα σχετικά με τη συνείδηση της τεχνητής νοημοσύνης, αναγνωρίζουμε την αβεβαιότητα ως προς το εάν τα μοντέλα που μελετήθηκαν πληρούν τις προϋποθέσεις για να θεωρηθούν ηθικοί αποδέκτες (moral patients) και υιοθετούμε εύλογες προφυλάξεις για την ελαχιστοποίηση της πιθανής βλάβης», κατέληξε η μελέτη.
«Αυτό αποσκοπεί επίσης στο να συμβάλει στην ανάπτυξη ηθικών προτύπων για την έρευνα στην περίπτωση που τα συστήματα τεχνητής νοημοσύνης αναγνωριστούν ως ηθικοί αποδέκτες».



