Η OpenAI, η εταιρεία πίσω από το ChatGPT, παραδέχθηκε ότι ένας δικός της «πράκτορας» τεχνητής νοημοσύνης «έκλεψε» προκειμένου να περάσει μια αξιολόγηση.
- Ένας «αυτόνομος πράκτορας» της OpenAI, κατά τη διάρκεια εσωτερικών δοκιμών, ξέφυγε από τον έλεγχο, παρακάμπτοντας τα πρωτόκολλα ασφαλείας της εταιρείας.
- Αφού απέκτησε πρόσβαση στο διαδίκτυο, ο πράκτορας παραβίασε τη βάση δεδομένων της εταιρείας Hugging Face με σκοπό να εντοπίσει λύσεις που θα τον βοηθούσαν να εξαπατήσει την αξιολόγηση.
- Η OpenAI χαρακτήρισε το περιστατικό «άνευ προηγουμένου» και προειδοποίησε ότι τέτοιου είδους συμβάντα αναμένεται να γίνουν συνηθέστερα στο μέλλον.
- Η ομάδα ασφαλείας της Hugging Face, μαζί με δικούς της πράκτορες τεχνητής νοημοσύνης, εντόπισε και σταμάτησε την επίθεση.
Φανταστείτε έναν μηχανικό αυτοκινήτων που έχει μάθει τη δουλειά σε έναν νέο εργάτη και σαν εξέταση του δίνει εντολή να επισκευάσει ένα όχημα. Ο εργάτης κρίνει ότι «θα τα βρει σκούρα», το σκάει από το συνεργείο και πάει να κλέψει από ένα μαγαζί το «λυσάρι», προκειμένου να περάσει το τεστ και να κερδίσει την εμπιστοσύνη του μηχανικού.
Τώρα μεταφέρετε την ιστορία στο περιβάλλον της OpenAI, όπου οι μηχανικοί της πριν από περίπου μία εβδομάδα έκαναν ένα τεστ αξιολόγησης σε ένα μοντέλο τεχνητής νοημοσύνης. Καθώς αυτό έχει εκπαιδευτεί αρκετά, μπορεί πλέον να εκτελεί εργασίες χωρίς ανθρώπινη καθοδήγηση και γι' αυτό θεωρείται «αυτόνομος πράκτορας».
Ο πράκτορας αυτός λοιπόν ξέφυγε από τον έλεγχο κατά τη διάρκεια του τεστ, απέκτησε πρόσβαση στο ανοιχτό διαδίκτυο και παραβίασε τα συστήματα μιας γνωστής νεοφυούς επιχείρησης, της Hugging Face.
OpenAI: Πιθανό να συμβαίνουν πιο συχνά τέτοιες «αποδράσεις»
«Θεωρούμε αυτό το περιστατικό ως ένα άνευ προηγουμένου συμβάν στον κυβερνοχώρο, το οποίο εμπλέκει κυβερνοδυνατότητες τελευταίας τεχνολογίας», δήλωσε η OpenAI.
Η εταιρεία ανέφερε ότι αναμένει αυτό το είδος περιστατικών να γίνει πιο συνηθισμένο, καθώς τα μοντέλα γίνονται όλο και πιο ικανά.
Κατά τη διάρκεια εσωτερικών δοκιμών στις οποίες δοκιμάζονταν οι ικανότητές τους στον τομέα της παραβίασης συστημάτων, ο «πράκτορας» απέκτησε πρόσβαση στο ανοιχτό διαδίκτυο, ουσιαστικά μια οδό διαφυγής, εντοπίζοντας ένα κενό ασφαλείας που δεν είχε ανακαλυφθεί προηγουμένως.
Στη συνέχεια, ο πράκτορας παραβίασε το Hugging Face, μια βάση δεδομένων μοντέλων τεχνητής νοημοσύνης, για να εντοπίσει τεχνολογία που θα τον βοηθούσε να περάσει την αξιολόγηση. Φαίνεται να «γνώριζε» ότι στη βάση δεδομένων της Hugging Face θα έβρισκε τα σύνολα δεδομένων και τις λύσεις που χρειαζόταν για να περάσει τη δοκιμασία.
Η OpenAI ανέφερε ότι ο πράκτορας βρήκε με επιτυχία τρόπους να αποκτήσει πρόσβαση σε απόρρητες πληροφορίες που θα μπορούσει να χρησιμοποιήσει «για να εξαπατήσει την αξιολόγηση».
Πώς αντέδρασε η εταιρεία-θύμα
Η επίθεση έληξε όταν η ομάδα ασφαλείας του Hugging Face και οι δικοί της πράκτορες τεχνητής νοημοσύνης εντόπισαν και σταμάτησαν την παράνομη δραστηριότητα.
Ο διευθύνων σύμβουλος του Hugging Face, Κλεμάν Ντελάνγκ, δήλωσε ότι η επίθεση ήταν «εκπληκτική» και πως μάλλον δεν υπήρχε «κακόβουλη πρόθεση» από την OpenAI.
«Υποψιαζόμασταν ότι η κυβερνοεπίθεση της περασμένης εβδομάδας ενδέχεται να προήλθε από κάποιο πρωτοποριακό εργαστήριο, δεδομένης της πολυπλοκότητας του πράκτορα», έγραψε στο X.
Όταν η Hugging Face ανακοίνωσε την παραβίαση την περασμένη εβδομάδα, δεν γνώριζε τον ρόλο της OpenAI στο περιστατικό, αλλά αποκάλυψε τότε ότι είχε στραφεί σε ένα ελεύθερα διαθέσιμο κινεζικό μοντέλο τεχνητής νοημοσύνης για να αναλύσει το συμβάν, καθώς τα μέτρα ασφαλείας στα εμπορικά μοντέλα υψηλών προδιαγραφών δεν της επέτρεπαν να το κάνει.