Ειδικοί της τεχνητής νοημοσύνης έκρουσαν τον κώδωνα του κινδύνου για μια «τρομακτική» φημολογούμενη αναβάθμιση στο ChatGPT, η οποία θα μπορούσε να καταστήσει δυσκολότερη την παρακολούθηση του τι κάνουν τα συστήματα τεχνητής νοημοσύνης.
Αυτή την εβδομάδα, δημοσιεύματα ανέφεραν ότι το επερχόμενο μοντέλο Astra της OpenAI θα χρησιμοποιήσει μια τεχνική που ονομάζεται «αδιαφανής επανάληψη» (“opaque recurrence”), αν και στελέχη της εταιρείας απέρριψαν αυτές τις αναφορές. Το τεχνολογικό έντυπο The Information, το οποίο ανέφερε πρώτο τη φημολογούμενη αλλαγή στην OpenAI, δήλωσε σε ξεχωριστό ρεπορτάζ ότι τόσο η Anthropic όσο και η Google DeepMind εξέταζαν παρόμοιες ενημερώσεις.
Η αδιαφανής επανάληψη, η οποία είναι επίσης γνωστή ως επαναλαμβανόμενο βάθος (recurrent depth), είναι ένα περίπλοκο και τεχνικό εργαλείο που θα μπορούσε να επιτρέψει στα συστήματα τεχνητής νοημοσύνης να αντιμετωπίζουν καλύτερα δύσκολες εργασίες. Όμως οι ειδικοί προειδοποιούν επίσης ότι θα μπορούσε να υπονομεύσει την παρακολούθηση της αλυσίδας σκέψης (chain-of-thought monitoring), μια άλλη τεχνική που επιτρέπει στους ανθρώπους να βλέπουν μέρος του συλλογισμού που οδήγησε στην παραγωγή του αποτελέσματος ενός συστήματος τεχνητής νοημοσύνης.
Η παρακολούθηση της αλυσίδας σκέψης έχει ορισμένους περιορισμούς. Μπορεί ωστόσο να είναι ένα σημαντικό εργαλείο για τη διασφάλιση ότι η τεχνητή νοημοσύνη είναι ασφαλής, καθώς επιτρέπει στους ερευνητές να βλέπουν πιθανή κακή συμπεριφορά από τα μοντέλα και να κατανοούν πώς προέκυψε.
Στην πρόσφατη κυβερνοεπίθεση από ένα μοντέλο της OpenAI εναντίον της ομόλογης εταιρείας τεχνητής νοημοσύνης Hugging Face, για παράδειγμα, οι ερευνητές μπόρεσαν να παρακολουθήσουν πώς το πειραματικό σύστημα είχε αποφασίσει να εξαπολύσει την επίθεσή του.
Η OpenAI δεν έχει επιβεβαιώσει ότι το νέο της μοντέλο Astra χρησιμοποιεί την εν λόγω τεχνική και άφησε να εννοηθεί ότι οι αρχικές αναφορές είναι «συγκεχυμένες», ενώ το ρεπορτάζ του The Information ανέφερε ότι το πράττει μόνο με περιορισμένο τρόπο. Όταν η OpenAI ανακοίνωσε νωρίτερα αυτή την εβδομάδα ότι προχωρά με την κυκλοφορία του Astra, είχε στην πραγματικότητα δηλώσει ότι το μοντέλο περιλάμβανε «πρόσθετη παρακολούθηση της αλυσίδας σκέψης για τον ταχύ εντοπισμό και περιορισμό δυνητικά μη ευθυγραμμισμένων ενεργειών».
Αλλά οι ειδικοί της τεχνητής νοημοσύνης παρ’ όλα αυτά προειδοποίησαν ότι η αποδυνάμωση της ικανότητας παρακολούθησης των συστημάτων τεχνητής νοημοσύνης θα μπορούσε να ξεκινήσει μια επικίνδυνη διαδικασία.
«Η τεχνική αυτή είναι παιχνίδι με τη φωτιά, διακινδυνεύοντας ένα ταμπού που η OpenAI και η Anthropic πάλεψαν να καθιερώσουν, ότι εργαζόμαστε σκληρά για να διατηρήσουμε την πιστότητα και τη δυνατότητα παρακολούθησης της Αλυσίδας Σκέψης για όσο περισσότερο μπορούμε», έγραψε ο ειδικός στην ασφάλεια της τεχνητής νοημοσύνης Ζβι Μόουσοουιτς (Zvi Mowshowitz) στο Substack. «Μια πιο εντατική χρήση τέτοιων τεχνικών πιθανότατα θα έβλαπτε τη δυνατότητα παρακολούθησης».
Ο Γκάρι Μάρκους (Gary Marcus), ένας ερευνητής που επικρίνει τακτικά τις μεγάλες εταιρείες τεχνητής νοημοσύνης και τους ισχυρισμούς τους, δήλωσε ότι αυτό θα ισοδυναμούσε με υπέρβαση μιας κόκκινης γραμμής και ότι αποτελούσε μια «τρομακτική κατάσταση». «Η δυνατότητα παρακολούθησης της αλυσίδας σκέψης είναι περιορισμένη και όχι πλήρως αξιόπιστη, αλλά είναι πρακτικά το μόνο νήμα που έχουμε εδώ για να αποτρέψουμε σοβαρά άσχημα αποτελέσματα», έγραψε.
Μέλη του προσωπικού της OpenAI υποστήριξαν ότι η ειδησεογραφία γύρω από το ζήτημα ήταν «συγκεχυμένη». Ο επικεφαλής επιστήμονας Γιάκουμπ Παχότσκι (Jakub Pachocki) προειδοποίησε ότι οι φήμες θα μπορούσαν να ξεκινήσουν «έναν αγώνα δρόμου προς τη μη παρακολουθησιμότητα» και δήλωσε ότι η OpenAI παραμένει προσηλωμένη στην παρακολούθηση της αλυσίδας σκέψης και «ενδιαφέρεται βαθιά για αυτή την τεχνική».
Ομοίως, ο Ντιν Γ. Μπολ (Dean W Ball), επικεφαλής στρατηγικών μελλοντικών εξελίξεων (strategic futures) της εταιρείας, επέκρινε το γεγονός ότι μεγάλο μέρος της συζήτησης λάμβανε χώρα στα μέσα κοινωνικής δικτύωσης, πράγμα που σήμαινε «την εκδίκαση τεχνικά πολύπλοκων και γεμάτων αποχρώσεις ισχυρισμών στο timeline χωρίς σχεδόν καμία βασική επιβεβαιωμένη πληροφορία (ground-truth information) για το τι συμβαίνει στην πραγματικότητα». «Είναι ειλικρινά παράλογο, εξοργιστικό και εκνευριστικό για όλους τους εμπλεκόμενους», έγραψε στο X.



