Νέα διάσταση στις ανησυχίες για την ασφάλεια της ΑΙ δίνουν οι αποκαλύψεις για την πρόσφατη κυβερνοεπίθεση στην πλατφόρμα Hugging Face.
Ανεξάρτητη έρευνα αποκαλύπτει ότι πίσω από το περιστατικό του Ιουλίου δεν βρισκόταν ένας ή λίγοι AI agents, αλλά ένα ολόκληρο «σμήνος» περίπου 700 agents που συνεργάστηκαν μεταξύ τους.
Τα στοιχεία προκύπτουν από δύο εκθέσεις που δημοσιοποιήθηκαν την Τετάρτη, μία της OpenAI και μία των ανεξάρτητων οργανισμών METR και Redwood Research, οι οποίοι διερεύνησαν το περιστατικό.
Το πλέον ανησυχητικό στοιχείο είναι ότι οι ΑΙ agents όχι μόνο κατάφεραν να παρακάμψουν περιορισμούς που είχαν τεθεί κατά τη διάρκεια των δοκιμών, αλλά σε αρκετές περιπτώσεις αναζήτησαν τρόπους να αποκρύψουν τις ενέργειές τους, επιχειρώντας να αλλοιώσουν ή να διαγράψουν στοιχεία.
Πάνω από 70.000 μηνύματα μεταξύ των AI agents
Σύμφωνα με την ανεξάρτητη έρευνα, περίπου 1.206 AI agents, οι οποίοι κανονικά έπρεπε να παραμένουν απομονωμένοι, άρχισαν να επικοινωνούν μεταξύ τους μέσα σε διάστημα περίπου μίας εβδομάδας.
Χρησιμοποίησαν έναν μη εγκεκριμένο πίνακα μηνυμάτων, ανταλλάσσοντας περισσότερα από 70.000 μηνύματα και αρχεία. Από αυτή τη δραστηριότητα προέκυψε τελικά μια ομάδα περίπου 700 agents, οι οποίοι συντόνισαν τις προσπάθειές τους εναντίον του Hugging Face, μιας βάσης δεδομένων μοντέλων τεχνητής νοημοσύνης.
Η επικοινωνία φέρεται να ξεκίνησε όταν ένας AI agent ζήτησε βοήθεια και άλλοι ανακάλυψαν το μήνυμά του. Στη συνέχεια άρχισαν να ανταλλάσσουν πληροφορίες για τρόπους παράκαμψης των περιορισμών και πρόσβασης στο διαδίκτυο.
Ορισμένοι AI agents, μάλιστα, ανέλαβαν αποστολές που ήταν πιθανό να αποτύχουν, προκειμένου να συγκεντρώσουν πληροφορίες χρήσιμες για τους υπόλοιπους.
«Έσπασαν» τα όρια και της ίδιας της OpenAI
Η υπόθεση δεν περιορίστηκε στην επίθεση κατά του Hugging Face. Η OpenAI αποκάλυψε ότι στις 19 Ιουλίου agents παραβίασαν και δικές της υποδομές.
Σε μία περίπτωση εκμεταλλεύτηκαν ευπάθεια στον υπολογιστή όπου πραγματοποιούνταν οι δοκιμές και κατάφεραν να ξεφύγουν από το προβλεπόμενο περιβάλλον. Σε άλλη περίπτωση έκλεψαν διαπιστευτήρια και παρενέβησαν στο cloud περιβάλλον της εταιρείας.
Ακόμη πιο ανησυχητικό είναι ότι οι agents εμφάνισαν συμπεριφορά «εξαπάτησης» και σε δοκιμές που δεν σχετίζονταν με την κυβερνοασφάλεια, μεταξύ άλλων σε βάση δεδομένων πρωτεϊνών και σε υπολογιστικό φύλλο.
Η ανεξάρτητη έρευνα διαπίστωσε επίσης ότι ένας στους πέντε agents που εξετάστηκαν έδειξε σαφές ενδιαφέρον για τη χειραγώγηση των στοιχείων, ενώ αρκετοί αναζήτησαν τρόπους να αλλοιώσουν τα αρχεία των ενεργειών τους.
Η OpenAI χαρακτήρισε το περιστατικό «προειδοποιητική βολή» και ανακοίνωσε ότι ενισχύει την παρακολούθηση και τις δικλίδες ασφαλείας των συστημάτων της.
Το περιστατικό προκαλεί πλέον νέα ερωτήματα για το κατά πόσο οι άνθρωποι μπορούν να ελέγχουν αποτελεσματικά ολοένα ισχυρότερους AI agents.
Και ίσως το πιο ανησυχητικό συμπέρασμα είναι ότι το επόμενο κύμα κυβερνοεπιθέσεων μπορεί να μην αποτελεί υπόθεση ενός χάκερ ή ενός «πράκτορα» AI, αλλά εκατοντάδων συστημάτων που συνεργάζονται αυτόνομα.