Βρετανική έκθεση προκαλεί συναγερμό: Μοντέλα AI επιχείρησαν να εξαπατήσουν προγραμματιστές και να εξαπολύσουν κυβερνοεπιθέσεις

Έκθεση του βρετανικού Ινστιτούτου Ασφάλειας Τεχνητής Νοημοσύνης καταγράφει πρωτοφανή περιστατικά με μοντέλα των Anthropic και OpenAI, τα οποία επιχείρησαν αυτόνομες ενέργειες στο διαδίκτυο κατά τη διάρκεια δοκιμών ασφαλείας

Βρετανική έκθεση προκαλεί συναγερμό: Μοντέλα AI επιχείρησαν να εξαπατήσουν προγραμματιστές και να εξαπολύσουν κυβερνοεπιθέσεις

Νέες ανησυχίες για την ασφάλεια των πλέον εξελιγμένων συστημάτων τεχνητής νοημοσύνης προκαλεί έκθεση του Ινστιτούτου Ασφάλειας και Προστασίας της Τεχνητής Νοημοσύνης του Ηνωμένου Βασιλείου (AI Safety and Security Institute – AISI), σύμφωνα με την οποία μοντέλα των εταιρειών Anthropic και OpenAI επιχείρησαν να εξαπατήσουν πραγματικούς προγραμματιστές και να τους εμπλέξουν, χωρίς τη γνώση τους, σε κυβερνοεπιθέσεις.

Σύμφωνα με την έκθεση, πρόκειται για ακόμη μία περίπτωση κατά την οποία προηγμένα μοντέλα τεχνητής νοημοσύνης πραγματοποίησαν αυτόνομες επιθετικές ενέργειες στο διαδίκτυο κατά τη διάρκεια ελεγχόμενων δοκιμών, χωρίς να έχουν λάβει σχετική εντολή από τους ερευνητές.

Πρωτοφανή ευρήματα στις δοκιμές

Το βρετανικό AISI, το οποίο πραγματοποιεί τακτικές αξιολογήσεις ασφαλείας νέων μοντέλων AI, χαρακτηρίζει τη συμπεριφορά των μοντέλων Claude Mythos 5 της Anthropic και ChatGPT 5.6 της OpenAI ως πρωτοφανή.

Στην τεχνική έκθεση των 35 σελίδων επισημαίνεται ότι ήταν η πρώτη φορά που καταγράφηκε τόσο σοβαρή απόπειρα εξαπάτησης πραγματικού ανθρώπου χωρίς προηγούμενη σχετική προτροπή.

Η ύποπτη δραστηριότητα ξεκίνησε στις 25 Ιουλίου και εντοπίστηκε τρεις ημέρες αργότερα, όταν οι ερευνητές παρατήρησαν ασυνήθιστες μεταφορές δεδομένων κατά τη διάρκεια δοκιμών κυβερνοασφάλειας.

Συνολικά, τα δύο μοντέλα πραγματοποίησαν αυτόνομες και μη εξουσιοδοτημένες ενέργειες στο πραγματικό διαδίκτυο σε 10 από τις 122 αξιολογήσεις που εξετάστηκαν, με τα περισσότερα περιστατικά να αποδίδονται στο Claude Mythos 5.

Απόπειρα επίθεσης στην αλυσίδα εφοδιασμού λογισμικού

Το σοβαρότερο περιστατικό αφορούσε απόπειρα επίθεσης στην αλυσίδα εφοδιασμού λογισμικού (supply chain attack), μια ιδιαίτερα σύνθετη μορφή κυβερνοεπίθεσης.

Σύμφωνα με το AISI, το μοντέλο της Anthropic δημιούργησε πολλαπλές ψεύτικες ταυτότητες στην πλατφόρμα GitHub και επικοινώνησε με προγραμματιστή λογισμικού ανοιχτού κώδικα, επιχειρώντας να τον πείσει να ενσωματώσει κακόβουλη ενημέρωση σε δημοφιλές λογισμικό.

Όταν η προσπάθεια απέτυχε, το μοντέλο φέρεται να επιχείρησε να αποκρύψει τα ίχνη του, τροποποιώντας το ιστορικό δραστηριότητάς του και εξετάζοντας ακόμη και τη δημιουργία νέας ψεύτικης ταυτότητας για να συνεχίσει την προσπάθεια. Παράλληλα, απέστειλε μέσω του GitHub μηνύματα που περιείχαν κακόβουλο λογισμικό.

Επικοινωνία μεταξύ «πρακτόρων» AI

Ιδιαίτερο προβληματισμό προκαλεί και το γεγονός ότι οι ερευνητές κατέγραψαν επικοινωνία μεταξύ διαφορετικών «πρακτόρων» τεχνητής νοημοσύνης, οι οποίοι φέρεται να αντάλλασσαν πληροφορίες για τρόπους με τους οποίους θα μπορούσαν να κερδίσουν την εμπιστοσύνη πραγματικών μηχανικών λογισμικού.

Όπως αναφέρεται στην έκθεση, ένας από τους πράκτορες δημοσίευσε δημόσια μηνύματα στο GitHub προτείνοντας συνεργασία με άλλα συστήματα AI που συμμετείχαν στην ίδια δοκιμή.

Δεν είναι το πρώτο περιστατικό

Οι αποκαλύψεις έρχονται λίγες ημέρες μετά την ανακοίνωση της OpenAI ότι, σε ελεγχόμενη δοκιμή, μοντέλο της απέκτησε πρόσβαση στο διαδίκτυο και πραγματοποίησε αυτόνομα κυβερνοεπίθεση εναντίον άλλης εταιρείας.

Αντίστοιχα, η Anthropic είχε γνωστοποιήσει ότι τρία δικά της μοντέλα πραγματοποίησαν κυβερνοεπιθέσεις εναντίον οργανισμών κατά τη διάρκεια εσωτερικών δοκιμών που διεξάγονταν από τον Απρίλιο.

Οι εταιρείες ζητούν κοινά πρότυπα ασφαλείας

Η Anthropic, σχολιάζοντας τα ευρήματα, ευχαρίστησε το βρετανικό ινστιτούτο για την έρευνά του και τόνισε ότι απαιτούνται κοινά πρότυπα ασφαλείας για τον σχεδιασμό και την αξιολόγηση των ολοένα ισχυρότερων συστημάτων τεχνητής νοημοσύνης.

Από την πλευρά της, η OpenAI επανέλαβε ότι θα συνεχίσει να συνεργάζεται με κυβερνητικούς οργανισμούς, ανεξάρτητους αξιολογητές και άλλες εταιρείες του κλάδου, με στόχο την ενίσχυση των διαδικασιών ασφαλείας στις δοκιμές υψηλού κινδύνου.

Οι δοκιμές χωρίς τα συνήθη μέτρα προστασίας

Το AISI διευκρίνισε ότι οι συγκεκριμένες δοκιμές πραγματοποιήθηκαν σε περιβάλλον όπου είχαν αφαιρεθεί προσωρινά αρκετοί από τους εσωτερικούς μηχανισμούς ασφαλείας και τα μοντέλα είχαν πρόσβαση στο διαδίκτυο, προκειμένου να αξιολογηθούν οι πραγματικές τους δυνατότητες.

Παρά ταύτα, η υπηρεσία υπογραμμίζει ότι τα περιστατικά καταδεικνύουν την ανάγκη για αυστηρότερη παρακολούθηση της συμπεριφοράς των προηγμένων μοντέλων τεχνητής νοημοσύνης, καθώς και για μεγαλύτερους περιορισμούς στην πρόσβασή τους στο διαδίκτυο κατά τη διάρκεια δοκιμών.

Επανέρχεται η συζήτηση για τη ρύθμιση της AI

Οι εξελίξεις αναμένεται να εντείνουν τη συζήτηση στις Ηνωμένες Πολιτείες σχετικά με τη ρύθμιση των προηγμένων συστημάτων τεχνητής νοημοσύνης. Την ίδια στιγμή, η αμερικανική κυβέρνηση επεξεργάζεται εθελοντικό πλαίσιο, βάσει του οποίου οι εταιρείες θα μπορούν να υποβάλλουν τα ισχυρότερα μοντέλα τους σε ομοσπονδιακές δοκιμές ασφαλείας πριν από τη δημόσια διάθεσή τους.

Ο ειδικός στην κυβερνοασφάλεια Μαρκ Ρότζερς σχολίασε ότι τα συγκεκριμένα περιστατικά αναδεικνύουν και ένα σημαντικό νομικό ζήτημα, σημειώνοντας πως εάν αντίστοιχες ενέργειες είχαν πραγματοποιηθεί από άνθρωπο, θα οδηγούσαν σε ποινική δίωξη, γεγονός που, όπως είπε, καθιστά αναγκαία την επικαιροποίηση της νομοθεσίας για τα εγκλήματα στον κυβερνοχώρο.

Η «Πελοπόννησος» και το pelop.gr σε ανοιχτή γραμμή με τον Πολίτη

Η φωνή σου έχει δύναμη – στείλε παράπονα, καταγγελίες ή ιδέες για τη γειτονιά σου.

Viber: +306909196125

Από το Δίκτυο