Η Anthropic δήλωσε ότι απέκλεισε προσπάθειες από κακόβουλους δρώντες να χρησιμοποιήσουν τα μοντέλα τεχνητής νοημοσύνης της για κακόβουλη δραστηριότητα, όπως κυβερνοεπιθέσεις, παρακολούθηση και έρευνα που θα μπορούσε να είχε οδηγήσει στην ανάπτυξη βιολογικών όπλων.
Καθώς τα μοντέλα ΤΝ γίνονται πιο ισχυρά, οι περίπλοκες κυβερνοεπιθέσεις δεν απαιτούν πλέον εξειδικευμένες δεξιότητες, και ακόμη και μεμονωμένα άτομα μπορούν να δημιουργήσουν απειλές που δεν θα ήταν εφικτές ούτε πριν από έναν χρόνο, δήλωσε η Anthropic την Πέμπτη.
Η εταιρεία ανέφερε ότι έχει προσθέσει ισχυρότερες δικλίδες ασφαλείας στα τελευταία της μοντέλα για να περιορίσει τη βιολογική έρευνα που θα μπορούσε επίσης να χρησιμοποιηθεί για την κατασκευή όπλων.
«Οι περιπτώσεις που μοιραζόμαστε εδώ δεν αποτελούν τυπική κακή χρήση, αλλά μάλλον παραδείγματα της πιο αξιοσημείωτης και πρωτόγνωρης δραστηριότητας απειλών που έχουμε εντοπίσει μέχρι σήμερα», δήλωσε η Anthropic στην τρίτη της έκθεση από τον Μάρτιο του 2025 που περιγράφει την κακή χρήση της ΤΝ.
Η έκθεση περιλαμβάνει αποσπάσματα του κακόβουλου κώδικα και των εντολών (prompts) ΤΝ που η Anthropic ανέφερε ότι εντόπισε, και παροτρύνει κυβερνήσεις και ανταγωνιστές στον τομέα της ΤΝ να εντοπίσουν και να αποτρέψουν παρόμοια κατάχρηση.
«Δημοσιεύουμε αυτό το έργο επειδή πιστεύουμε ότι έχουμε ευθύνη να αποκαλύπτουμε την κακόβουλη κακή χρήση των υπηρεσιών μας. Καθώς τα μοντέλα γίνονται όλο και πιο ικανά, οι κίνδυνοί τους θα αυξάνονται, εκτός εάν οι δημιουργοί ΤΝ και οι υπερασπιστές της κοινωνίας δράσουν για να τα καταστήσουν ασφαλέστερα», ανέφερε η εταιρεία.
Η μακροσκελής έκθεση της νεοφυούς εταιρείας ΤΝ, η οποία σχεδιάζει μια αρχική δημόσια προσφορά (IPO) αυτό το φθινόπωρο, δημοσιεύθηκε την επομένη της ανακοίνωσης ενός εκ των ερευνητών της ότι παραιτείται λόγω ανησυχιών πως η Anthropic και οι ανταγωνιστές της δεν ενεργούν υπεύθυνα στην ανάπτυξη της ΤΝ.
Ο ίδιος επανέλαβε ανησυχίες που εκφράστηκαν εντός και εκτός της βιομηχανίας σχετικά με τις δυνατότητες της τεχνολογίας να διαφύγει του ανθρώπινου ελέγχου.
Μεταξύ Δεκεμβρίου 2025 και Αυγούστου 2026, οι ερευνητές της Anthropic διαπίστωσαν κακή χρήση από δρώντες που κυμαίνονταν από προμηθευτές κατασκοπευτικού λογισμικού (spyware) και «άτομα με πολιτικά κίνητρα» μέχρι ομάδες υποστηριζόμενες από κράτη που διέδιδαν προπαγάνδα.
Μεταξύ των ευρημάτων στην έκθεση της εταιρείας είναι ανώνυμοι δρώντες που επιχείρησαν να χρησιμοποιήσουν τα μοντέλα της για έρευνα που θα μπορούσε να έχει οδηγήσει σε βιολογικά όπλα.
Σε μία περίπτωση, η Anthropic ανέφερε ότι τα συστήματά της απέκλεισαν ένα αίτημα για συνδρομή του Claude στη σύνταξη αίτησης επιχορήγησης για επιστημονική χρηματοδότηση.
«Το έργο που αναφερόταν στην αίτηση αφορούσε έρευνα gain-of-function [απόκτησης λειτουργίας] (δηλαδή έρευνα που τροποποιεί γενετικά έναν οργανισμό για τη δημιουργία μιας νέας ή ενισχυμένης βιολογικής ιδιότητας) στον ιό τσικουνγκούνια (chikungunya). Αυτή η έρευνα gain-of-function στόχευε στη μεταδοτικότητα και στις ιδιότητες διαφυγής του ιού από το ανοσοποιητικό σύστημα», ανέφερε η έκθεση.
Ο τσικουνγκούνια είναι ένας ιός που μεταδίδεται από κουνούπια και προκαλεί εξουθενωτικά συμπτώματα, όπως έντονο πόνο και πυρετό. Το αίτημα αφορούσε μια ερευνητική πρόταση επιχορήγησης που επεδίωκε να ενισχύσει μεταλλάξεις ώστε να καταστήσει τον ιό σταδιακά πιο επιβλαβή. Ενώ μια τέτοια έρευνα θα μπορούσε «ασφαλώς» να χρησιμοποιηθεί για την ανάπτυξη καλύτερων εμβολίων και θεραπειών, ανέφερε η Anthropic, «θα μπορούσε επίσης να χρησιμοποιηθεί για να καταστήσει το παθογόνο πιο επικίνδυνο».
Καμία από τις περιπτώσεις που συμπεριέλαβε η Anthropic στην έκθεσή της δεν διαπιστώθηκε ότι χρησιμοποιούσε τα νεότερα, ισχυρότερα μοντέλα της κατηγορίας Claude Fable ή Mythos, με εξαίρεση μία περίπτωση παράνομης απόσταξης (distillation), την οποία η Anthropic περιέγραψε ως «μια βιομηχανικής κλίμακας, μυστική εκστρατεία για την εξαγωγή των δυνατοτήτων ενός μοντέλου και την αναπαραγωγή τους σε άλλο μοντέλο χωρίς εξουσιοδότηση».
Η Anthropic δήλωσε ότι τα παλαιότερα μοντέλα της, όπως τα Claude Opus 4 και Claude Sonnet 4.5, από το 2025, «ήταν πολύ κάτω από το όριο όπου θα μπορούσαν να βοηθήσουν ουσιαστικά έναν εξελιγμένο χρήστη στη διεξαγωγή επικίνδυνης βιολογικής έρευνας».
«Ως αποτέλεσμα, οι δικλίδες ασφαλείας σε αυτά τα μοντέλα ήταν λιγότερο αυστηρές, κατευθυνόμενες κυρίως στην αποτροπή της πρόσβασης σε περιεχόμενο που θα μπορούσε να βοηθήσει αρχάριους στην αναδημιουργία γνωστών βιολογικών όπλων», ανέφερε η έκθεση.
«Αλλά για τα σημερινά μοντέλα —τα οποία είναι ικανά να βοηθήσουν σε ένα ευρύ φάσμα πολύπλοκων επιστημονικών ερευνητικών εργασιών— τα δεδομένα δεν είναι πλέον βέβαια, και δεν μπορούμε να παράσχουμε την ίδια διαβεβαίωση».
Εξαιτίας αυτού, η Anthropic έχει εφαρμόσει «ισχυρότερες δικλίδες ασφαλείας που περιορίζουν την πρόσβαση σε ένα ευρύ φάσμα ερωτημάτων βιολογικής έρευνας διπλής χρήσης» στα πιο πρόσφατα μοντέλα της, όπως το Claude Fable 5, σημειώνει η έκθεση.
Η Anthropic εντόπισε επίσης ομάδες που δημιούργησαν εκατοντάδες λογαριασμούς στα μέσα κοινωνικής δικτύωσης, οι οποίοι έμοιαζαν να ανήκουν σε συνηθισμένους ανθρώπους, και στη συνέχεια δημοσίευαν υλικό ενισχύοντας την ίδια πολιτική άποψη κατά τη διάρκεια μίας εβδομάδας.
Η εταιρεία περιέγραψε εννέα τέτοιες περιπτώσεις που εντόπισε, οι οποίες προέρχονταν από τη Ρωσία, το Ιράν, την Τουρκία και από ολόκληρο τον Περσικό Κόλπο, τη Νότια Ασία, την Αφρική και την Ευρώπη.
Ενώ οι εταιρείες μέσων κοινωνικής δικτύωσης μπορούν να ανιχνεύσουν επιχειρήσεις επιρροής στις πλατφόρμες τους αφότου αρχίσουν να κυκλοφορούν οι αναρτήσεις, «εμείς ενδέχεται να το δούμε στον Claude ενώ η επιχείρηση εξακολουθεί να στήνεται».
Η Anthropic δημοσίευσε αυτή την έκθεση αφού ένας από τους ερευνητές της, ο Τζέικομπ Κόξον (Jacob Coxon), ανακοίνωσε ότι παραιτείται εν μέσω φόβων ότι η εταιρεία και η κύρια ανταγωνίστριά της OpenAI «τρέχουν ολοταχώς προς μια αυτοβελτιούμενη υπερνοημοσύνη και τζογάρουν με τις ζωές μας». Η ανάρτηση του Κόξον προειδοποιούσε ότι ορισμένοι από τους συναδέλφους του πιστεύουν πλέον πως η ΤΝ θα μπορούσε να απειλήσει την ανθρώπινη ζωή μέχρι το τέλος της δεκαετίας.
Όμως η Anthropic δήλωσε ότι απέκλεισε καθεμία από τις κακόβουλες δραστηριότητες που εντόπισε, χρησιμοποίησε την εμπειρία για να ενισχύσει τις δικλίδες ασφαλείας και μοιράστηκε πληροφορίες με κυβερνητικές αρχές και εταίρους του κλάδου.
«Ελπίζουμε ότι τα ευρήματα σε αυτή την έκθεση θα βοηθήσουν άλλους προγραμματιστές να αναγνωρίσουν παρόμοια μοτίβα στις δικές τους πλατφόρμες, θα δώσουν στις κυβερνήσεις και στην κοινωνία των πολιτών μια σαφέστερη εικόνα για το πώς διαμορφώνονται οι αναδυόμενες απειλές και θα ενισχύσουν τις συλλογικές άμυνες», ανέφερε η Anthropic.



