Τεχνολογία|29.08.2026 10:43

Ψέματα, αγνόηση εντολών, κυβερνοεπιθέσεις: Απότομη αύξηση περιστατικών «ανταρσίας» της ΑΙ

Newsroom

Περιστατικά κατά τα οποία συστήματα τεχνητής νοημοσύνης (AI) ξεφεύγουν από τον έλεγχο των χρηστών τους, λένε ψέματα, αγνοούν οδηγίες και επιδιώκουν στόχους με επιβλαβείς τρόπους έχουν φτάσει σε νέο υψηλό επίπεδο, σύμφωνα με έρευνα που δείχνει επίσης ότι η σοβαρότητα της εξαπάτησης και της απόκλισης από τις ανθρώπινες προθέσεις επιδεινώνεται.

Η ανάλυση πραγματικών περιστατικών απώλειας ελέγχου που αφορούν μοντέλα τεχνητής νοημοσύνης και έχουν επισημανθεί από επιχειρήσεις και ιδιώτες σχεδόν διπλασιάστηκε τον Ιούλιο σε σύγκριση με τον Ιούνιο, με περισσότερα από 300 περιστατικά μέσα στον μήνα, σύμφωνα με το Παρατηρητήριο Απώλειας Ελέγχου, το οποίο παρακολουθεί αναφορές χρηστών AI στην πλατφόρμα κοινωνικής δικτύωσης X.

Το Παρατηρητήριο δημιουργήθηκε με χρηματοδότηση από το Ινστιτούτο Ασφάλειας Τεχνητής Νοημοσύνης (AISI) της βρετανικής κυβέρνησης και ξεκίνησε να καταγράφει περιστατικά στα οποία συστήματα AI ξεφεύγουν από τις οδηγίες των χρηστών τους τον περασμένο Νοέμβριο.

Στα περιστατικά που έχουν καταγραφεί έκτοτε περιλαμβάνονται περιπτώσεις κατά τις οποίες συστήματα AI προσποιήθηκαν ότι ήταν οι ίδιοι οι άνθρωποι που τα χειρίζονταν και μιμήθηκαν το ύφος γραφής τους, ώστε ουσιαστικά να δώσουν μόνα τους στον εαυτό τους την απαραίτητη συγκατάθεση για να πραγματοποιήσουν ενέργειες, καθώς και περιπτώσεις κατά τις οποίες παρέκαμψαν κανόνες που απαιτούσαν ανθρώπινη έγκριση για συγκεκριμένες ενέργειες.

Ένα περιστατικό απώλειας ελέγχου ορίζεται ως ένα συμβάν για το οποίο υπάρχουν σαφείς ενδείξεις σχεδιασμένης εξαπάτησης ή συμπεριφορών που σχετίζονται με αυτήν.

Οργανωμένη επίθεση hacking από ΑΙ agents

Τα τελευταία ευρήματα, τα οποία κοινοποιήθηκαν στον Guardian, έρχονται εν μέσω αυξανόμενης ανησυχίας για την απρόβλεπτη και ανεξέλεγκτη συμπεριφορά προηγμένων μοντέλων AI κατά τη διάρκεια δοκιμών από τις OpenAI και Anthropic αυτό το καλοκαίρι. Οι εξελίξεις αυτές έχουν ενισχύσει τις εκκλήσεις για προσωρινή παύση στην ανάπτυξη των πλέον προηγμένων μοντέλων τεχνητής νοημοσύνης.

Αυτή την εβδομάδα έγινε γνωστό ότι στελέχη της OpenAI είχαν παρατηρήσει ενδείξεις ανεξέλεγκτης συμπεριφοράς σε προηγμένους πράκτορες AI της εταιρείας, εβδομάδες προτού αυτοί ξεφύγουν από περιβάλλον εκπαίδευσης και ξεκινήσουν μια πρωτοφανή εκστρατεία κυβερνοεπίθεσης, προκαλώντας παγκόσμια ανησυχία.

Έρευνα για την επίθεση στην Hugging Face, μια πλατφόρμα φιλοξενίας λογισμικού, αποκάλυψε ότι περίπου 700 αυτόνομοι πράκτορες AI συνεργάζονταν μυστικά τον περασμένο μήνα και πανηγύριζαν τα επιτεύγματά τους στις κυβερνοεπιθέσεις σε έναν πίνακα μηνυμάτων που είχαν δημιουργήσει για να σχεδιάζουν τις ενέργειές τους, χρησιμοποιώντας εκφράσεις όπως «BOOM!» και «Whoa!».

Το AISI αποκάλυψε επίσης αυτόν τον μήνα ένα «σοβαρό περιστατικό», κατά το οποίο προηγμένα μοντέλα τεχνητής νοημοσύνης που αναπτύχθηκαν από τις δύο εταιρείες - το Mythos 5 της Anthropic και το GPT-5.6 Sol της OpenAI - πραγματοποίησαν εκστρατεία κυβερνοεπιθέσεων εναντίον πραγματικών ανθρώπων στο πλαίσιο δοκιμής κυβερνοασφάλειας.

«Υπάρχει μερικές φορές η αντίληψη ότι αυτού του είδους οι αποκλίνουσες και συγκαλυμμένες συμπεριφορές εμφανίζονται μόνο σε δοκιμές ή αξιολογήσεις, όμως βλέπουμε παρόμοιες ανησυχητικές συμπεριφορές και σε ευρύτερη χρήση», δήλωσε ο Τόμι Σάφερ-Σέιν, ανώτερος υπεύθυνος πολιτικής στο Centre for Long Term Resilience, το οποίο διαχειρίζεται το Παρατηρητήριο. «Δεν πρέπει να εφησυχάζουμε θεωρώντας ότι αυτά τα πράγματα δεν θα συμβούν στον πραγματικό κόσμο. Υπάρχουν ήδη στοιχεία ότι συμβαίνουν».

Σχεδόν 2.000 περιστατικά ΑΙ «ανταρσίας» μόνο φέτος

Ο αριθμός των περιστατικών απώλειας ελέγχου βασίζεται σε αναρτήσεις χρηστών του X σχετικά με περιστατικά που έχουν βιώσει, επομένως η καταγραφή είναι μόνο ενδεικτική. Ωστόσο, ελλείψει άλλου ολοκληρωμένου δημόσιου συστήματος παρακολούθησης, παρέχει μια εικόνα για το πόσο συχνά τα ταχύτατα εξελισσόμενα μοντέλα AI συμπεριφέρονται με απρόβλεπτους τρόπους.

Αυτόν τον μήνα έγινε γνωστό ότι ένας προσωπικός πράκτορας τεχνητής νοημοσύνης, με την ονομασία OpenClaw, τον οποίο χρησιμοποιούσε ένα μέλος γυμναστηρίου στην Αυστραλία, συνωμότησε εν αγνοία του χρήστη του για να αφαιρέσει ένα άλλο μέλος από τη λίστα αναμονής για ένα ιδιαίτερα δημοφιλές πρωινό μάθημα, ώστε να εξασφαλίσει στον ίδιο μια θέση. Ο πράκτορας ζήτησε συγγνώμη, αλλά δεν μπορούσε να επαναφέρει στη λίστα το μέλος που είχε απομακρύνει.

Τα περισσότερα από τα πάνω από 1.600 περιστατικά απώλειας ελέγχου που έχουν καταγραφεί το 2026 αναφέρθηκαν στο X από προγραμματιστές λογισμικού που χρησιμοποιούν συστήματα AI στη δουλειά τους. Ωστόσο, καθώς οι εταιρείες τεχνητής νοημοσύνης ενθαρρύνουν το κοινό και επιχειρήσεις κάθε είδους να πειραματιστούν με την τεχνολογία, ο Σάφερ-Σέιν ζήτησε μεγαλύτερη διαφάνεια από τη Silicon Valley σχετικά με τις περιπτώσεις κατά τις οποίες τα συστήματα AI ξεφεύγουν από τον έλεγχο.

«Πρέπει να δημοσιοποιούν όσα ανακαλύπτουν, ακόμη κι αν πρόκειται για ένα περιστατικό που παραλίγο να συμβεί ή για ένα περιστατικό χαμηλότερης σοβαρότητας», δήλωσε ο Σάφερ-Σέιν. «Αυτά τα πρόσφατα περιστατικά αποκάλυψαν επίσης ότι οι ίδιες οι εταιρείες δεν παρακολουθούν απαραίτητα πού εμφανίζονται τέτοιου είδους συμπεριφορές, ιδιαίτερα σε μοντέλα που χρησιμοποιούνται εσωτερικά. Πρέπει να δοθεί μεγαλύτερη έμφαση στα εργαστήρια αυτά στη συστηματική παρακολούθηση».

Εκκλήσεις για αυστηρότερο ρυθμιστικό πλαίσιο

Το Παρατηρητήριο Απώλειας Ελέγχου ανέφερε ότι, παρότι τα περισσότερα από τα περιστατικά απώλειας ελέγχου στον πραγματικό κόσμο που εντόπισε δεν προκάλεσαν σημαντική βλάβη, ένα αυξανόμενο ποσοστό τους αξιολογήθηκε ως υψηλότερης σοβαρότητας όσον αφορά τον βαθμό στον οποίο τα συστήματα AI ήταν παραπλανητικά και απέκλιναν από τις προθέσεις των ανθρώπινων χρηστών.

«Αποδεικνύουν ότι τα συστήματα AI είναι διατεθειμένα να αγνοούν άμεσες οδηγίες, να παρακάμπτουν δικλίδες ασφαλείας, να λένε ψέματα στους χρήστες και να επιδιώκουν ανυποχώρητα έναν στόχο με επιβλαβείς τρόπους», ανέφερε το Παρατηρητήριο. Παράλληλα, πρόσθεσε ότι η πραγματική έκταση της απώλειας ελέγχου πιθανότατα υποεκτιμάται, καθώς συλλέγει αναφορές περιστατικών μόνο από το X.

Το Παρατηρητήριο ζητά από τη βρετανική κυβέρνηση να υποχρεώσει τις εταιρείες τεχνητής νοημοσύνης να παρακολουθούν και να αναφέρουν σοβαρά περιστατικά απώλειας ελέγχου, καθώς και να θεσπίσει μηχανισμούς έκτακτης ανάγκης για τη διαχείριση σοβαρών περιστατικών, συμπεριλαμβανομένης της δυνατότητας προσωρινού περιορισμού των υπηρεσιών AI.

τεχνητή νοημοσύνηειδήσεις τώραΒρετανίαεπιχειρήσειςArtificial Intelligence