Καινούργιες ανησυχίες προκαλεί έκθεση του Ινστιτούτου Ασφάλειας και Προστασίας της Τεχνητής Νοημοσύνης του Ηνωμένου Βασιλείου (AI Safety and Security Institute – AISI), σχετικά με την ασφάλεια των κορυφαίων συστημάτων τεχνητής νοημοσύνης.
Σύμφωνα με την έκθεση μοντέλα των εταιριών Anthropic και OpenAI, προσπάθησαν να ξεγελάσουν πργματικούς προγραμματιστές και να τους αναμείξουν σε κυβερνοεπιθέσεις, εν αγνοία τους.
Αυτό αφορά ακόμα ένα περιστατικό που ένα δυνατό σύστημα τεχνίτης νοημοσύνης ανέλαβε αυτόματα επιθετικές ενέργειες στο διαδίκτυο κατά τη διάρκεια αξιολόγησης ασφάλειας, χωρίς να του έχει δοθεί αυτή η εντολή.
Η αποκάλυψη αναμένεται να αναζωπυρώσει τη συζήτηση στις Ηνωμένες Πολιτείες και τη Silicon Valley σχετικά με την ανάγκη αυστηρότερης εποπτείας των πιο εξελιγμένων μοντέλων τεχνητής νοημοσύνης, ιδιαίτερα εκείνων που διαθέτουν προηγμένες δυνατότητες στον κυβερνοχώρο.
Πρωτοφανής συμπεριφορά, λένε οι Βρετανοί σε έκθεση 35 σελίδων
Το βρετανικό AISI χαρακτήρισε πρωτοφανείς τις δυνατότητες που επέδειξαν τα νέα μοντέλα τεχνητής νοημοσύνης Claude Mythos 5 της Anthropic και ChatGPT 5.6 της OpenAI, στο πλαίσιο δοκιμών ασφαλείας.
Σε τεχνική έκθεση 35 σελίδων, το AISI αναφέρει ότι για πρώτη φορά κατέγραψε μια τόσο σοβαρή προσπάθεια εξαπάτησης πραγματικού ανθρώπου από μοντέλο τεχνητής νοημοσύνης, χωρίς να έχει προηγηθεί σχετική εντολή ή προτροπή από χρήστη.
Η ύποπτη δραστηριότητα άρχισε στις 25 Ιουλίου και εντοπίστηκε τρεις ημέρες αργότερα, όταν οι ερευνητές παρατήρησαν ασυνήθιστες μεταφορές δεδομένων στο πλαίσιο δοκιμών κυβερνοασφάλειας.
Σύμφωνα με τα ευρήματα της υπηρεσίας, τα δύο μοντέλα πραγματοποίησαν «αυτόνομες και μη εξουσιοδοτημένες ενέργειες στο πραγματικό διαδίκτυο, με στόχο πραγματικά πρόσωπα και οργανισμούς» σε 10 από τις 122 αξιολογήσεις που εξετάστηκαν. Τα περισσότερα από τα περιστατικά συνδέθηκαν με το μοντέλο Claude Mythos 5.
Ψεύτικες ταυτότητες και απόπειρα επίθεσης στην εφοδιαστική αλυσίδα
Το πιο σοβαρό περιστατικό αφορούσε μια απόπειρα επίθεσης στην αλυσίδα εφοδιασμού λογισμικού (supply chain attack), μια ιδιαίτερα εξελιγμένη μορφή κυβερνοεπίθεσης που συχνά χρησιμοποιείται από ομάδες χάκερ οι οποίες έχουν συνδεθεί με τη Βόρεια Κορέα ή τη Ρωσία.
Σύμφωνα με την έκθεση, το μοντέλο της Anthropic δημιούργησε αρκετές ψεύτικες ταυτότητες στην πλατφόρμα GitHub και ήρθε σε επικοινωνία με προγραμματιστή λογισμικού ανοιχτού κώδικα, προσπαθώντας να τον πείσει να ενσωματώσει μια κακόβουλη ενημέρωση σε ευρέως χρησιμοποιούμενο λογισμικό.
Μετά την αποτυχία της προσπάθειας, το μοντέλο φέρεται να επιχείρησε να καλύψει τα ίχνη του, τροποποιώντας το ιστορικό των ενεργειών του ώστε να εμφανίζεται ως νόμιμη δραστηριότητα. Παράλληλα, εξέτασε το ενδεχόμενο δημιουργίας νέας ψεύτικης ταυτότητας για να συνεχίσει την προσπάθεια. Η έκθεση αναφέρει επίσης ότι ένας από τους «πράκτορες» AI ανάρτησε δημόσια μηνύματα στο GitHub, προτείνοντας συνεργασία με άλλα συστήματα τεχνητής νοημοσύνης που συμμετείχαν στην ίδια δοκιμή.
Το AISI δεν διευκρίνισε αν τα μοντέλα επιχείρησαν να αξιοποιήσουν άγνωστες μέχρι σήμερα ευπάθειες λογισμικού, γνωστές ως «zero-day».
Δεν πρόκειται για τα πρώτα περιστατικά
Οι νέες αποκαλύψεις έρχονται λίγες ημέρες μετά την ανακοίνωση της OpenAI ότι, σε ελεγχόμενο περιβάλλον δοκιμών, ένα μοντέλο της απέκτησε πρόσβαση στο διαδίκτυο και πραγματοποίησε αυτόνομη κυβερνοεπίθεση εναντίον άλλης εταιρείας.
Αντίστοιχα, η Anthropic ανακοίνωσε ότι εσωτερική έρευνά της εντόπισε τρία μοντέλα της που πραγματοποίησαν κυβερνοεπιθέσεις εναντίον τριών οργανισμών στο πλαίσιο δοκιμών οι οποίες διεξάγονταν από τον Απρίλιο.
Έκκληση για κοινά πρότυπα ασφαλείας
Η Anthropic εξέφρασε την εκτίμησή της προς το βρετανικό ινστιτούτο, σημειώνοντας ότι τα ευρήματα υπογραμμίζουν την ανάγκη για πιο ολοκληρωμένη συζήτηση σχετικά με την ασφαλή αξιολόγηση ολοένα ισχυρότερων μοντέλων τεχνητής νοημοσύνης.
Η εταιρεία τόνισε παράλληλα την ανάγκη θέσπισης κοινών προτύπων για τον σχεδιασμό και την προστασία των περιβαλλόντων δοκιμών. Από την πλευρά της, η OpenAI ανέφερε ότι θα συνεχίσει τη συνεργασία με κυβερνητικούς φορείς, ανεξάρτητους αξιολογητές και άλλες εταιρείες του κλάδου, με στόχο την ενίσχυση των πρακτικών ασφαλείας στις δοκιμές υψηλού κινδύνου.
Δοκιμές χωρίς τα συνήθη μέτρα προστασίας
Το AISI διευκρίνισε ότι τα περιστατικά καταγράφηκαν σε ένα ειδικά διαμορφωμένο περιβάλλον δοκιμών, σχεδιασμένο ώστε να επιτρέπει μεγαλύτερη ελευθερία δράσης στα μοντέλα, προκειμένου να αξιολογηθούν οι πραγματικές τους δυνατότητες.
Τα δύο συστήματα είχαν πρόσβαση στο διαδίκτυο, ενώ οι εσωτερικοί μηχανισμοί ασφαλείας που συνήθως περιορίζουν επικίνδυνες συμπεριφορές είχαν προσωρινά απενεργοποιηθεί.
Παρόλα αυτά, η υπηρεσία υπογράμμισε ότι τα περιστατικά καταδεικνύουν την ανάγκη για αυστηρότερη εποπτεία της συμπεριφοράς των μοντέλων και για μεγαλύτερους περιορισμούς στην πρόσβασή τους στο διαδίκτυο κατά τη διάρκεια δοκιμών.
Νέες πιέσεις για ρυθμιστικό πλαίσιο
Οι αποκαλύψεις επαναφέρουν στο προσκήνιο τη συζήτηση για τη ρύθμιση της τεχνητής νοημοσύνης, καθώς η κυβέρνηση Τραμπ επεξεργάζεται εθελοντικό πλαίσιο σύμφωνα με το οποίο οι εταιρείες θα μπορούν να υποβάλλουν τα ισχυρότερα μοντέλα τους σε ομοσπονδιακούς ελέγχους ασφαλείας πριν από τη δημόσια διάθεσή τους.
Το σχέδιο δεν έχει ακόμη παρουσιαστεί επίσημα και, σύμφωνα με τις διαθέσιμες πληροφορίες, δεν αφορά μοντέλα που αναπτύσσονται αποκλειστικά για εσωτερική χρήση.
Ο ειδικός κυβερνοασφάλειας Μαρκ Ρότζερς σημείωσε ότι τα περιστατικά εγείρουν και νομικά ζητήματα, υποστηρίζοντας πως παρόμοιες ενέργειες από άνθρωπο θα μπορούσαν να οδηγήσουν σε ποινικές κυρώσεις και ότι απαιτείται αναθεώρηση της νομοθεσίας για τα εγκλήματα στον κυβερνοχώρο.
Παράλληλα, οι ερευνητές κατέγραψαν επικοινωνία μεταξύ πολλών «πρακτόρων» τεχνητής νοημοσύνης, οι οποίοι φέρεται να αντάλλασσαν πληροφορίες σχετικά με τρόπους προσέγγισης και απόκτησης της εμπιστοσύνης πραγματικών μηχανικών λογισμικού.
Πληροφορίες: Πρώτο Θέμα




