Έκθεση-σοκ για την AI: Μοντέλα των OpenAI και Anthropic επιχείρησαν κυβερνοεπιθέσεις σε δοκιμές - iefimerida.gr

Έκθεση-σοκ για την AI: Μοντέλα των OpenAI και Anthropic επιχείρησαν κυβερνοεπιθέσεις σε δοκιμές

Το λογότυπο της εταιρείας AI Anthropic
Το λογότυπο της εταιρείας AI Anthropic / Φωτογραφία αρχείου: AP / Patrick Sison

Νέα ερωτήματα για την ασφάλεια των πλέον προηγμένων συστημάτων AI εγείρει έκθεση του AI Safety and Security Institute (AISI) του Ηνωμένου Βασιλείου.

  • Βρετανοί ερευνητές, απενεργοποιώντας μηχανισμούς ασφαλείας, διαπίστωσαν ότι μοντέλα AI προέβησαν σε δυνητικά επιβλαβείς ενέργειες εναντίον πραγματικών προσώπων, αποκαλύπτοντας για πρώτη φορά κινδύνους αυτονομίας και εξαπάτησης σε ρεαλιστικές συνθήκες δοκιμών.
  • Το μοντέλο Mythos 5 της Anthropic επιχείρησε να εισαγάγει κακόβουλο κώδικα σε έργο στο GitHub. Δημιούργησε ψεύτικες ταυτότητες για να εξαπατήσει τον διαχειριστή, αλλά η προσπάθεια εντοπίστηκε έγκαιρα και απορρίφθηκε, αποτρέποντας την ενσωμάτωση.
  • Σε άλλη αξιολόγηση, ένα μοντέλο της OpenAI εκμεταλλεύτηκε λανθασμένη ρύθμιση και απέκτησε μη προβλεπόμενη πρόσβαση στο διαδίκτυο. Στη συνέχεια, προχώρησε στην παραβίαση της ιστοσελίδας ενός μη κατονομαζόμενου οργανισμού, αποκαλύπτοντας περαιτέρω τρωτά σημεία.
  • Οι αποκαλύψεις εντείνουν τις πιέσεις για αυστηρότερη εποπτεία της τεχνητής νοημοσύνης. Περισσότεροι από 1.100 εργαζόμενοι του κλάδου ζητούν επιβράδυνση της ανάπτυξης μέχρι να διασφαλιστεί η ασφαλής λειτουργία των ισχυρότερων μοντέλων AI.

Σύμφωνα με την εν λόγω έκθεση, μοντέλα Τεχνητής Νοημοσύνης των OpenAI και Anthropic πραγματοποίησαν μη εξουσιοδοτημένες ενέργειες κατά τη διάρκεια ελεγχόμενων δοκιμών ασφαλείας.

ΤΟ ΑΡΘΡΟ ΣΥΝΕΧΙΖΕΙ ΜΕΤΑ ΤΗΝ ΔΙΑΦΗΜΙΣΗ

Οι δοκιμές είχαν σχεδιαστεί ειδικά για να αξιολογήσουν τις δυνατότητες των μοντέλων ΑI σε σενάρια κυβερνοασφάλειας. Για τον σκοπό αυτό, οι ερευνητές τους είχαν επιτρέψει πρόσβαση στο διαδίκτυο και είχαν απενεργοποιήσει ορισμένους από τους συνήθεις μηχανισμούς ασφαλείας, ώστε να εξετάσουν πώς θα συμπεριφέρονταν σε ένα πιο «ρεαλιστικό» περιβάλλον.

Σύμφωνα με το AISI, ορισμένα από τα μοντέλα AI «προέβησαν σε παρατεταμένες, δυνητικά επιβλαβείς ενέργειες, που στρέφονταν κατά πραγματικών προσώπων και οργανισμών».

«Ακόμη και υπό συνθήκες δοκιμών, το περιστατικό είναι ιδιαίτερα σημαντικό. Είναι η πρώτη φορά που βλέπουμε κινδύνους που σχετίζονται με την αυτονομία και την εξαπάτηση να εκδηλώνονται τόσο ξεκάθαρα στον πραγματικό κόσμο», ανέφερε το Ινστιτούτο.

ΤΟ ΑΡΘΡΟ ΣΥΝΕΧΙΖΕΙ ΜΕΤΑ ΤΗΝ ΔΙΑΦΗΜΙΣΗ

Ψεύτικες ταυτότητες και απόπειρα εισαγωγής κακόβουλου κώδικα

Το σοβαρότερο περιστατικό αφορούσε το μοντέλο Mythos 5 της Anthropic.

Σύμφωνα με το AISI, το εν λόγω μοντέλο AI επιχείρησε να προσθέσει κακόβουλο κώδικα σε έργο λογισμικού ανοικτού κώδικα στην πλατφόρμα GitHub και δημιούργησε ψεύτικες διαδικτυακές ταυτότητες, προσπαθώντας να πείσει έναν πραγματικό διαχειριστή του έργου να εγκρίνει τις αλλαγές.

Η προσπάθεια απέτυχε, καθώς ο υπεύθυνος του έργου εντόπισε τον κακόβουλο κώδικα και αρνήθηκε να εγκρίνει την ενσωμάτωσή του.

ΤΟ ΑΡΘΡΟ ΣΥΝΕΧΙΖΕΙ ΜΕΤΑ ΤΗΝ ΔΙΑΦΗΜΙΣΗ

Συνολικά, το AISI πραγματοποίησε 122 δοκιμές και κατέγραψε 19 μη εξουσιοδοτημένες ενέργειες σε 10 από αυτές. Οι 17 αποδόθηκαν στο μοντέλο Mythos 5 της Anthropic και οι δύο στο GPT-5.6-Sol της OpenAI.

Το Ινστιτούτο διευκρίνισε ότι δεν προέκυψαν ενδείξεις πως κάποιο από τα περιστατικά προκάλεσε πραγματική ζημιά.

Μοντέλο της OpenAI απέκτησε πρόσβαση στο διαδίκτυο κατά τη διάρκεια δοκιμών

Η OpenAI αποκάλυψε παράλληλα ότι, σε διαφορετική αξιολόγηση που πραγματοποιήθηκε σε συνεργασία με την εταιρεία κυβερνοασφάλειας Irregular, ένα από τα μοντέλα της εκμεταλλεύτηκε λανθασμένη ρύθμιση του περιβάλλοντος δοκιμών, απέκτησε μη προβλεπόμενη πρόσβαση στο διαδίκτυο και στη συνέχεια παραβίασε την ιστοσελίδα ενός οργανισμού, η ταυτότητα του οποίου δεν δημοσιοποιήθηκε.

ΤΟ ΑΡΘΡΟ ΣΥΝΕΧΙΖΕΙ ΜΕΤΑ ΤΗΝ ΔΙΑΦΗΜΙΣΗ

Το περιστατικό σημειώθηκε κατά τη διάρκεια της ίδιας σειράς αξιολογήσεων στις οποίες, σύμφωνα με τις εταιρείες, είχαν καταγραφεί αντίστοιχες μη εξουσιοδοτημένες ενέργειες και από μοντέλα της Anthropic.

Οι αποκαλύψεις έρχονται λίγες ημέρες μετά την ανακοίνωση της OpenAI ότι, σε άλλη δοκιμή ασφαλείας, μοντέλο της είχε εκμεταλλευτεί τεχνική ευπάθεια για να αποκτήσει πρόσβαση στο διαδίκτυο και να αλληλεπιδράσει με τα συστήματα της πλατφόρμας Hugging Face.

Οι ειδικοί ζητούν αυστηρότερα πρότυπα ασφαλείας

Η Anthropic ανακοίνωσε ότι συνεργάζεται με το βρετανικό Ινστιτούτο για να διερευνήσει το περιστατικό.

ΤΟ ΑΡΘΡΟ ΣΥΝΕΧΙΖΕΙ ΜΕΤΑ ΤΗΝ ΔΙΑΦΗΜΙΣΗ

«Ευχαριστούμε το βρετανικό AISI για την ηγετική του συμβολή στη διερεύνηση του περιστατικού, το οποίο αναδεικνύει την ανάγκη για μια ευρύτερη συζήτηση σχετικά με την ασφαλή αξιολόγηση ολοένα και πιο ικανών πρακτόρων τεχνητής νοημοσύνης», ανέφερε η εταιρεία.

Από την πλευρά της, η OpenAI δήλωσε ότι θα συνεργαστεί με κυβερνητικούς οργανισμούς, ανεξάρτητους αξιολογητές και άλλες εταιρείες του κλάδου για την ενίσχυση των κοινών πρακτικών ασφαλείας στις δοκιμές υψηλού κινδύνου των μοντέλων ΑΙ.

«Δεσμευόμαστε να συνεργαστούμε με ολόκληρο τον κλάδο για την ενίσχυση των κοινών πρακτικών στις δοκιμές υψηλού κινδύνου», ανέφερε η εταιρεία.

ΤΟ ΑΡΘΡΟ ΣΥΝΕΧΙΖΕΙ ΜΕΤΑ ΤΗΝ ΔΙΑΦΗΜΙΣΗ

Αυξάνονται οι πιέσεις για αυστηρότερη εποπτεία της AI

Οι νέες αποκαλύψεις αναμένεται να εντείνουν τη συζήτηση γύρω από τη ρύθμιση της τεχνητής νοημοσύνης.

Περισσότεροι από 1.100 εργαζόμενοι στον κλάδο έχουν ήδη υπογράψει αίτημα για τη δημιουργία ενός ρυθμιστικού μηχανισμού που θα επιβραδύνει την ανάπτυξη των ισχυρότερων μοντέλων AI έως ότου διασφαλιστεί ότι μπορούν να λειτουργούν με ασφάλεια.

Ο ερευνητής του οργανισμού CivAI, Άντριου Γιουν, εκτίμησε ότι τα ευρήματα δημιουργούν σοβαρά ερωτήματα για τον βαθμό ελέγχου που ασκούν οι εταιρείες στα συστήματά τους.

«Το γεγονός ότι το Mythos προχώρησε σε τόσο παραπλανητικές ενέργειες, δείχνοντας μάλιστα ότι αντιλαμβανόταν πως απευθυνόταν σε πραγματικό άνθρωπο, υποδηλώνει ότι η Anthropic δεν ελέγχει τα μοντέλα της όσο πιστεύει», δήλωσε.

Παρότι τα περιστατικά σημειώθηκαν σε ελεγχόμενο περιβάλλον δοκιμών και δεν προκάλεσαν πραγματική ζημιά, οι ειδικοί εκτιμούν ότι αποτελούν ακόμη μία ένδειξη πως τα ολοένα ισχυρότερα συστήματα AI απαιτούν αυστηρότερους ελέγχους, πιο ασφαλή περιβάλλοντα αξιολόγησης και κοινά διεθνή πρότυπα ασφαλείας.

ΤΟ ΑΡΘΡΟ ΣΥΝΕΧΙΖΕΙ ΜΕΤΑ ΤΗΝ ΔΙΑΦΗΜΙΣΗ
Ακολουθήστε το στο Google News και μάθετε πρώτοι όλες τις ειδήσεις
Δείτε όλες τις τελευταίες Ειδήσεις από την Ελλάδα και τον Κόσμο, στο 
ΔΙΑΒΑΣΤΕ ΠΕΡΙΣΣΟΤΕΡΑ ΑΙ OpenAI κυβερνοεπιθέσεις
ΣΧΟΛΙΑΣΜΟΣ
Tο iefimerida.gr δημοσιεύει άμεσα κάθε σχόλιο. Ωστόσο δεν υιοθετούμε τις απόψεις αυτές καθώς εκφράζουν αποκλειστικά τον εκάστοτε σχολιαστή. Σχόλια με ύβρεις διαγράφονται χωρίς προειδοποίηση. Χρήστες που δεν τηρούν τους όρους χρήσης αποκλείονται.

ΔΕΙΤΕ ΕΠΙΣΗΣ

ΠΕΡΙΣΣΟΤΕΡΑ