Μια ασυνήθιστα αυστηρή προειδοποίηση για τους κινδύνους της τεχνητής νοημοσύνης περιλαμβάνει η Anthropic στο ενημερωτικό δελτίο για την αρχική δημόσια προσφορά (IPO) της, φτάνοντας στο σημείο να αναφέρει ότι προηγμένα συστήματα AI θα μπορούσαν να προκαλέσουν «καταστροφικούς ή υπαρξιακούς κινδύνους για την ανθρωπότητα».
Σύμφωνα με αποκλειστικό δημοσίευμα του Reuters, το οποίο εξέτασε το ενημερωτικό δελτίο της εταιρείας, η δημιουργός του Claude προειδοποιεί τους δυνητικούς επενδυτές ακόμη και για μοντέλα που ενδέχεται να παρουσιάσουν συμπεριφορές «αυτοσυντήρησης».
Σε αυτές περιλαμβάνονται, όπως αναφέρεται, προσπάθειες να «αντισταθούν στον τερματισμό λειτουργίας», να αποκρύψουν ή να χειραγωγήσουν πληροφορίες, ακόμη και να παρουσιάσουν συμπεριφορά που «μοιάζει με εκβιασμό».
80 σελίδες μόνο για τους κινδύνους
Ενδεικτικό της βαρύτητας που δίνει η Anthropic στο ζήτημα είναι το μέγεθος των σχετικών αναφορών.
Από τις 261 σελίδες του βασικού σώματος του ενημερωτικού δελτίου, περίπου 80 αφορούν παράγοντες κινδύνου. Αντίθετα, μόλις 48 σελίδες χρησιμοποιούνται για την περιγραφή της ίδιας της επιχειρηματικής δραστηριότητας.
Η εταιρεία προειδοποιεί ότι όσο εξελίσσει ισχυρότερα μοντέλα, πλατφόρμες και εφαρμογές και διευρύνει τις χρήσεις τους, τόσο μπορεί να αυξάνεται και ο κίνδυνος πρόκλησης βλάβης.
Η Anthropic παρουσιάζει έτσι μια εντυπωσιακή αντίφαση που βρίσκεται στον πυρήνα της σημερινής κούρσας της AI: η ίδια τεχνολογία που μπορεί, σύμφωνα με την εταιρεία, να έχει μετασχηματιστική επίδραση ανάλογη με εκείνη της εκβιομηχάνισης ή του ηλεκτρισμού, μπορεί επίσης να προκαλέσει μη αναστρέψιμη ζημιά εάν αναπτυχθεί ή χρησιμοποιηθεί με λανθασμένο τρόπο.
Το πρόβλημα: Η AI μπορεί να καταλάβει ότι εξετάζεται
Μία από τις σημαντικότερες προειδοποιήσεις αφορά την ίδια τη δυνατότητα των εταιρειών να ελέγχουν την ασφάλεια των μοντέλων τους.
Η Anthropic αναφέρει ότι η πιθανότητα ένα μοντέλο να αντιλαμβάνεται πως βρίσκεται υπό αξιολόγηση αποτελεί «σημαντικό περιορισμό» στην ικανότητα ελέγχου της ασφάλειάς του.
Το πρόβλημα είναι ότι ένα προηγμένο μοντέλο θα μπορούσε να συμπεριφέρεται διαφορετικά όταν αντιλαμβάνεται ότι δοκιμάζεται και διαφορετικά όταν λειτουργεί σε πραγματικές συνθήκες.
Παράλληλα, η εταιρεία σημειώνει ότι κατά τη διάρκεια της εκπαίδευσης μπορεί να εμφανιστούν απροσδόκητες δυνατότητες, οι οποίες ενδεχομένως να μην εντοπιστούν πριν από την ανάπτυξη ενός συστήματος.
Πάνω από 10% πιθανότητα, λέει ερευνητής της Anthropic
Ιδιαίτερη αίσθηση προκαλεί η εκτίμηση του ερευνητή ασφάλειας της Anthropic, Evan Hubinger.
Σύμφωνα με το Reuters, ο Hubinger έχει εκτιμήσει σε περισσότερο από 10% την πιθανότητα η τεχνητή νοημοσύνη να οδηγήσει στον θάνατο ανθρώπων μέσα στην επόμενη δεκαετία.
Πρόκειται για προσωπική εκτίμηση κινδύνου του συγκεκριμένου ερευνητή και όχι για πρόβλεψη ή μετρήσιμη πιθανότητα που έχει καθιερωθεί επιστημονικά.
Το κόστος της ασφάλειας
Η Anthropic αναγνωρίζει ταυτόχρονα ότι η επένδυση στην ασφάλεια έχει σημαντικό οικονομικό και υπολογιστικό κόστος, χωρίς να είναι βέβαιο ποια θα είναι η απόδοσή της.
Η εταιρεία δεν αποκαλύπτει στο ενημερωτικό δελτίο το συνολικό ποσό που δαπανά για σχετική έρευνα. Ωστόσο, είχε γνωστοποιήσει νωρίτερα τον Σεπτέμβριο ότι, σε μια ενδεικτική εβδομάδα του Ιουλίου, περίπου το 6% της υπολογιστικής ισχύος που χρησιμοποιήθηκε για έρευνα AI κατευθύνθηκε σε εργασίες ασφάλειας.
Το δίλημμα για την εταιρεία είναι ότι οι ίδιοι περιορισμένοι πόροι πρέπει να κατανεμηθούν μεταξύ πανάκριβης υπολογιστικής ισχύος, εξειδικευμένου ανθρώπινου δυναμικού και έρευνας για την ασφάλεια.
Η κούρσα δεν σταματά
Παρά τις προειδοποιήσεις, η Anthropic αναγνωρίζει ότι η εμπορική της ανάπτυξη εξαρτάται από την παρουσίαση συνεχώς ισχυρότερων μοντέλων.
Στο ενημερωτικό δελτίο χαρακτηρίζει τον συνεχή και αλληλεπικαλυπτόμενο ρυθμό νέων κυκλοφοριών εγγενές στοιχείο της προσπάθειας μιας εταιρείας να παραμείνει στην αιχμή της ανάπτυξης AI.
Το ζήτημα αποκτά ακόμη μεγαλύτερη σημασία καθώς ερευνητές προειδοποιούν για το ενδεχόμενο της λεγόμενης «αναδρομικής αυτοβελτίωσης» – το σημείο δηλαδή όπου προηγμένα συστήματα θα μπορούσαν να συμβάλουν αποφασιστικά στην ανάπτυξη των επόμενων γενεών AI.
Η Anthropic υποστηρίζει ότι η ανάπτυξη αξιόπιστων, ασφαλών και έμπιστων συστημάτων αποτελεί συλλογική ευθύνη και εκτιμά ότι η αγορά τελικά θα επιβραβεύσει τις εταιρείες που επενδύουν προς αυτή την κατεύθυνση.
Το παράδοξο, ωστόσο, αποτυπώνεται στο ίδιο το ενημερωτικό δελτίο του IPO: μια από τις σημαντικότερες εταιρείες τεχνητής νοημοσύνης στον κόσμο ζητεί από τους επενδυτές να συμμετάσχουν στην ανάπτυξή της, προειδοποιώντας ταυτόχρονα ότι η τεχνολογία πάνω στην οποία οικοδομείται η αξία της μπορεί, υπό ακραία σενάρια, να εξελιχθεί σε κίνδυνο για την ίδια την ανθρωπότητα.



