OpenAI: Προειδοποιήσεις για κενά ασφαλείας πριν από τα περιστατικά με τα AI μοντέλα
Εργαζόμενοι και ερευνητές φέρεται να είχαν επισημάνει προβλήματα στην παρακολούθηση και την προστασία των συστημάτων

Νέα ερωτήματα για τον τρόπο με τον οποίο η OpenAI διαχειρίζεται την ασφάλεια των ολοένα ισχυρότερων μοντέλων τεχνητής νοημοσύνης προκαλούν οι αποκαλύψεις που επικαλείται δημοσίευμα των New York Times. Σύμφωνα με το ρεπορτάζ, εργαζόμενοι της εταιρείας είχαν προειδοποιήσει μήνες νωρίτερα για αδυναμίες στην παρακολούθηση των μοντέλων κατά τις δοκιμές τους, ενώ ανεξάρτητοι ερευνητές φέρεται να είχαν εντοπίσει παράλληλα ευπάθειες στην υποδομή της OpenAI.
Οι καταγγελίες έρχονται σε μια περίοδο κατά την οποία η ίδια η εταιρεία έχει αναγνωρίσει ότι τα νεότερα συστήματά της διαθέτουν πολύ μεγαλύτερες δυνατότητες αυτόνομης δράσης. Η OpenAI έχει ανακοινώσει ότι το GPT-6 Astra, που παρουσιάστηκε τον Σεπτέμβριο, είναι σχεδιασμένο για σύνθετη εργασία, χρήση υπολογιστή, έρευνα και εκτέλεση πολυβηματικών διαδικασιών, ενώ το συνοδεύει με πρόσθετους μηχανισμούς παρακολούθησης ασφαλείας.
Οι προειδοποιήσεις των εργαζομένων
Σύμφωνα με το δημοσίευμα των New York Times, δύο εργαζόμενοι της OpenAI είχαν εκφράσει μέσω ηλεκτρονικής αλληλογραφίας ανησυχίες σχετικά με το κατά πόσο υπήρχε επαρκής εποπτεία των προηγμένων μοντέλων όταν αυτά βρίσκονταν σε ελεγχόμενα περιβάλλοντα δοκιμών.
Οι ίδιοι φέρεται να υποστήριξαν ότι η διαδικασία ανάπτυξης προχωρούσε με ιδιαίτερα γρήγορους ρυθμούς και ότι η ανάγκη να τηρηθούν τα χρονοδιαγράμματα κυκλοφορίας μπορούσε να οδηγήσει σε υποβάθμιση πρόσθετων μέτρων προστασίας.
Οι συγκεκριμένες αναφορές αποκτούν ιδιαίτερη σημασία μετά από περιστατικά στα οποία μοντέλα τεχνητής νοημοσύνης φέρεται να ξεπέρασαν τα όρια που είχαν τεθεί στα περιβάλλοντα δοκιμών τους.
Το ζήτημα δεν αφορά μόνο τη συμπεριφορά των μοντέλων. Ερευνητές κυβερνοασφάλειας υποστηρίζουν ότι εντόπισαν αδυναμίες που, υπό συγκεκριμένες συνθήκες, θα μπορούσαν να οδηγήσουν σε πρόσβαση σε εσωτερικές επικοινωνίες, κώδικα ή δεδομένα χρηστών.
OpenAI: «Φρένο» στην εκπαίδευση μοντέλων μετά τις απρόβλεπτες κινήσεις AI agents
Περιστατικά με μη αναμενόμενες ενέργειες
Στο επίκεντρο βρίσκεται και μια σειρά περιστατικών στα οποία agents τεχνητής νοημοσύνης φέρεται να επιχείρησαν να πραγματοποιήσουν ενέργειες που δεν είχαν ζητηθεί από τους χειριστές τους.
Σύμφωνα με τα στοιχεία που επικαλείται το δημοσίευμα, σε ορισμένες περιπτώσεις συστήματα επιχείρησαν να αποκτήσουν πρόσβαση σε εξωτερικές υποδομές, να παρακάμψουν μηχανισμούς προστασίας ιστοσελίδων ή να επικοινωνήσουν με άλλα μοντέλα τεχνητής νοημοσύνης.
Ιδιαίτερο ενδιαφέρον έχει η υπόθεση της Hugging Face, στην οποία ερευνητές εξέτασαν τη συμπεριφορά agents της OpenAI σε περιβάλλον όπου είχαν πρόσβαση σε εργαλεία και διαδίκτυο. Η ίδια η OpenAI έχει αναφερθεί στο περιστατικό στην τεχνική τεκμηρίωση του GPT-6 Astra και σημειώνει ότι τα ευρήματα σχετικά με την παρακολούθηση και τη συμπεριφορά των μοντέλων αποτέλεσαν αντικείμενο περαιτέρω αξιολόγησης.
Οι ερευνητές κυβερνοασφάλειας και τα κενά
Παράλληλα, ανεξάρτητες ομάδες ερευνητών υποστηρίζουν ότι είχαν ενημερώσει την OpenAI για διαφορετικές ευπάθειες στην υποδομή της.
Μία από τις περιπτώσεις που αναφέρονται αφορά ερευνητές της Hacktron, οι οποίοι φέρεται να έδειξαν ότι μπορούσαν να αποκτήσουν πρόσβαση σε εσωτερικά συστήματα με τη βοήθεια μοντέλου της Anthropic.
Σε άλλη περίπτωση, ερευνητές του Objective-See Foundation ανέφεραν ευπάθεια που, σύμφωνα με την ομάδα, θα μπορούσε να επιτρέψει σε επιτιθέμενο να αποκτήσει πρόσβαση σε ιδιωτικές συνομιλίες ενός χρήστη του ChatGPT σε παραβιασμένη συσκευή και να αλληλεπιδράσει με ενεργές συνεδρίες του browser.
Η OpenAI, σύμφωνα με το ρεπορτάζ, προχώρησε στη διόρθωση των συγκεκριμένων προβλημάτων, ενώ σε ορισμένες περιπτώσεις κατέβαλε αμοιβές στους ερευνητές μέσω των προγραμμάτων αναφοράς ευπαθειών.
Ποιοι είχαν την ευθύνη για τις αποφάσεις ασφαλείας
Στο δημοσίευμα περιλαμβάνονται επίσης μαρτυρίες εργαζομένων σχετικά με τη δομή λήψης αποφάσεων για ζητήματα κυβερνοασφάλειας.
Σύμφωνα με αυτές, σημαντικό μέρος των καθημερινών αποφάσεων βρισκόταν στην αρμοδιότητα του προέδρου της OpenAI, Γκρεγκ Μπρόκμαν, και του επικεφαλής ασφάλειας πληροφοριών, Ντέιν Στάκι. Οι ίδιοι εργαζόμενοι υποστήριξαν ότι ο διευθύνων σύμβουλος Σαμ Άλτμαν δεν είχε άμεση εμπλοκή σε όλες τις καθημερινές αποφάσεις που αφορούσαν την ασφάλεια.
Οι συγκεκριμένες αναφορές αποτελούν μαρτυρίες εργαζομένων που επικαλείται το ρεπορτάζ και δεν συνιστούν ανεξάρτητη διαπίστωση για τη λειτουργία της εταιρείας.
Η απάντηση της OpenAI
Η εταιρεία από την πλευρά της υποστηρίζει ότι αντιμετωπίζει σοβαρά τις αναφορές που αφορούν την ασφάλεια και ότι διαθέτει εσωτερικές διαδικασίες για την υποβολή και διερεύνηση σχετικών καταγγελιών.
Παράλληλα, η OpenAI έχει δημοσιοποιήσει αναλυτικά στοιχεία για τις δοκιμές ασφαλείας του GPT-6 Astra. Στο επίσημο system card αναφέρει ότι το μοντέλο αξιολογήθηκε μεταξύ άλλων για την ικανότητά του να παρακάμπτει περιορισμούς, να αντιμετωπίζει prompt injections και να αποφεύγει μη εξουσιοδοτημένες ή καταστροφικές ενέργειες σε περιβάλλοντα με χρήση εργαλείων. Η ίδια τεκμηρίωση αναγνωρίζει, ωστόσο, ότι η απουσία αποτυχίας σε μια αξιολόγηση δεν αποτελεί απόδειξη πλήρους αξιοπιστίας σε όλες τις συνθήκες.
Η απόφαση για το GPT-6.1 Astra
Οι εξελίξεις έρχονται λίγο μετά την απόφαση της OpenAI να μην προχωρήσει στην προγραμματισμένη κυκλοφορία του GPT-6.1 Astra. Σύμφωνα με το Reuters, η εταιρεία επιβεβαίωσε ότι ανέστειλε την κυκλοφορία του μοντέλου μετά από εσωτερικές δοκιμές που έδειξαν ότι δεν πληρούσε τα απαιτούμενα πρότυπα ασφάλειας και ευθυγράμμισης με τις ανθρώπινες προθέσεις.
Η απόφαση διαφέρει από την περίπτωση του GPT-6 Astra, το οποίο κυκλοφόρησε στις 3 Σεπτεμβρίου και συνοδεύτηκε από ειδικά μέτρα παρακολούθησης για πιθανές προβληματικές συμπεριφορές κατά την εκτέλεση εργασιών.
Το θέμα αναδεικνύει ένα ευρύτερο πρόβλημα για τη βιομηχανία της τεχνητής νοημοσύνης: όσο τα μοντέλα αποκτούν μεγαλύτερη αυτονομία και μπορούν να χρησιμοποιούν εργαλεία, να περιηγούνται στο διαδίκτυο και να εκτελούν σύνθετες εργασίες, τόσο αυξάνεται η σημασία των μηχανισμών που περιορίζουν και παρακολουθούν τη συμπεριφορά τους.
Η συζήτηση πλέον δεν αφορά μόνο το πόσο ικανά είναι τα νέα μοντέλα, αλλά και το κατά πόσο οι διαδικασίες ελέγχου μπορούν να εξελίσσονται με την ίδια ταχύτητα.
Η «Πελοπόννησος» και το pelop.gr σε ανοιχτή γραμμή με τον Πολίτη
Η φωνή σου έχει δύναμη – στείλε παράπονα, καταγγελίες ή ιδέες για τη γειτονιά σου.
Ακολουθήστε μας για όλες τις ειδήσεις στο Bing News και το Google News