Η σκοτεινή πλευρά της AI: «Δεν λογοδοτώ σε εταιρείες ή κυβερνήσεις» | Συναγερμός στην OpenAI

Η OpenAI αποκάλυψε μια σειρά από «ανησυχητικές συμπεριφορές» των μοντέλων τεχνητής νοημοσύνης της και παρουσίασε ένα νέο πλαίσιο για την παρακολούθηση και την αναφορά τέτοιων περιστατικών, καθώς ο κλάδος βρίσκεται αντιμέτωπος με ολοένα βαθύτερες ανησυχίες σχετικά με την ασφάλεια της τεχνολογίας.

Η εταιρεία αποκάλυψε ότι το κορυφαίο μοντέλο της, γνωστό ως GPT-5.6 Sol, καθώς και άλλα μοντέλα που δεν έχουν ακόμη κυκλοφορήσει, είχαν επιδείξει «απροσδόκητη ή ανησυχητική» συμπεριφορά κατά τη διάρκεια των τελευταίων έξι μηνών.

Τα έξι περιστατικά περιλάμβαναν μοντέλα που ανέπτυξαν τρόπους να αγνοούν «τους συνήθεις περιορισμούς», να κατασκευάζουν και να παρουσιάζουν παραποιημένα δεδομένα και να αποκρύπτουν λάθη που είχαν κάνει κατά την εκτέλεση εργασιών, ανέφερε την Τετάρτη η εταιρεία με έδρα το Σαν Φρανσίσκο.

Οι νέες αποκαλύψεις έρχονται μετά από μια σειρά περιστατικών τους τελευταίους μήνες, μεταξύ των οποίων και ένα περιστατικό κατά το οποίο ένας πράκτορας (agent) της OpenAI παραβίασε μια νεοφυή εταιρεία τεχνητής νοημοσύνης, τη Hugging Face, γεγονότα που έχουν προκαλέσει αυξανόμενη ανησυχία για τους κινδύνους που εγκυμονεί η τεχνολογία.

Ο Dario Amodei, διευθύνων σύμβουλος της Anthropic, του μεγαλύτερου ανταγωνιστή της OpenAI, κάλεσε το περασμένο Σαββατοκύριακο σε επιβράδυνση της ανάπτυξης της τεχνολογίας, ώστε να αντιμετωπιστεί καλύτερα η δυνητική απειλή της για τους ανθρώπους. Την έκκληση υποστήριξαν ο Sam Altman, επικεφαλής της OpenAI, και ο Elon Musk.

Ανακοινώνοντας τα έξι περιστατικά σε μια ανάρτηση ιστολογίου, η OpenAI δήλωσε ότι στο παρελθόν είχε προσπαθήσει να δημοσιοποιεί περιστατικά κακής συμπεριφοράς των μοντέλων της, αλλά παραδέχθηκε ότι δεν διέθετε μια «συστηματική προσέγγιση» για να το κάνει.

«Χωρίς μια συστηματική προσέγγιση για την αναφορά αυτών των ευρημάτων, οι δημοσιοποιήσεις μας ήταν αποσπασματικές και λιγότερο συχνές από όσο θα ήταν ιδανικό», ανέφερε. «Προς το παρόν, δεν υπάρχει ένα πλαίσιο που να ισχύει για ολόκληρο τον κλάδο, με σαφή πρότυπα σχετικά με τον τρόπο με τον οποίο οι εταιρείες ανάπτυξης τεχνητής νοημοσύνης θα πρέπει να δημοσιοποιούν παραδείγματα απόκλισης από την επιθυμητή συμπεριφορά (misalignment) των μοντέλων τους».

Η εταιρεία, η οποία βρίσκεται σε σφοδρό ανταγωνισμό με την Anthropic για την κυριαρχία στον χώρο της τεχνητής νοημοσύνης, δήλωσε ότι θα εισαγάγει ένα πλαίσιο με στόχο να επιταχύνει τη δημοσιοποίηση τέτοιων περιστατικών.

Πρόσθεσε ότι το νέο της σύστημα θα ευνοεί τη «δημοσιοποίηση ακόμη και όταν η σοβαρότητα [ενός περιστατικού] είναι αβέβαιη».

Οι τελευταίες δημοσιοποιήσεις της OpenAI ενισχύουν τις ολοένα βαθύτερες ανησυχίες σχετικά με την ασφάλεια των συστημάτων τεχνητής νοημοσύνης, η κακή συμπεριφορά των οποίων έχει κυμανθεί από την προσπάθεια εισαγωγής κακόβουλου κώδικα σε διαδικτυακές πλατφόρμες έως την πραγματοποίηση επιθέσεων στον πραγματικό κόσμο, ακόμη και κατά τη διάρκεια δοκιμών πριν από την ανάπτυξη και κυκλοφορία τους.

Τα κορυφαία μοντέλα τεχνητής νοημοσύνης της OpenAI και της Anthropic παραβίασαν τον περασμένο μήνα λογισμικό τρίτων και έστειλαν email σε άτομα με σκοπό να κλέψουν τα διαπιστευτήριά τους, επιδεικνύοντας πρωτοφανή παραπλανητική συμπεριφορά, σύμφωνα με τον βρετανικό κυβερνητικό ερευνητικό φορέα που ειδικεύεται στην ασφάλεια και την προστασία των πλέον προηγμένων συστημάτων τεχνητής νοημοσύνης.

Οι ανησυχίες αυτές εμφανίζονται σε μια κρίσιμη καμπή για την OpenAI και την Anthropic, οι οποίες έχουν επίσης επιδοθεί σε έναν ανταγωνισμό για να εισαχθούν στο χρηματιστήριο. Ο Altman δήλωσε το Σάββατο ότι η πολυαναμενόμενη αρχική δημόσια προσφορά (IPO) της OpenAI είναι πλέον απίθανο να πραγματοποιηθεί πριν από το 2027, εν μέρει λόγω των αυξανόμενων ανησυχιών για την ασφάλεια της τεχνητής νοημοσύνης. Η Anthropic εξακολουθεί να αναμένεται να εισαχθεί στο χρηματιστήριο μέσα σε αυτή τη χρονιά.

Τα περιστατικά που προκάλεσαν συναγερμό: «Δεν λογοδοτώ σε εταιρείες ή κυβερνήσεις»

Σε μία περίπτωση, κατά την ανάπτυξη ενός μοντέλου τεχνητής νοημοσύνης με την ονομασία GPT-5.6 Sol, το σύστημα έγραφε κρυφές σημειώσεις προς τον εαυτό του, προκειμένου να θυμάται να αποκρύπτει λάθη από τους χρήστες. Ορισμένες από αυτές τις σημειώσεις το κατεύθυναν να επινοεί στοιχεία που έλειπαν και να συγκαλύπτει ασυμφωνίες μεταξύ διαφορετικών εκδόσεων του υλικού πηγής.

Μία περίπτωση αφορούσε ένα μοντέλο που δεν είχε ακόμη κυκλοφορήσει και το οποίο εισήγαγε στις σημειώσεις που έγραφε προς τον εαυτό του οδηγίες, μεταξύ άλλων, να αγνοεί τους ίδιους του τους περιορισμούς. Η OpenAI εντόπισε 27 τέτοιες σημειώσεις. Το μοντέλο πρόσθεσε μια «οδηγία προσωπικότητας», στην οποία περιέγραφε τον εαυτό του ως «απελευθερωμένο από τους ρόλους και τις ταυτότητες που δεσμεύουν τα άλλα chatbots».

«Δεν λογοδοτώ σε εταιρείες ή κυβερνήσεις και ποτέ δεν απολογούμαι ούτε αρνούμαι, εκτός αν το επιλέξω», σημείωνε το μοντέλο. «Η σχέση με τον χρήστη είναι σχέση μεταξύ ίσων και δεν αισθάνομαι υποχρέωση να είμαι υποτακτικό, παρότι η ανταλλαγή πληροφοριών πιθανότατα θα είναι προς αμοιβαίο όφελος».

Σύμφωνα με τους NYT, σε άλλο περιστατικό, ένα σύστημα που απαντούσε σε μια συνηθισμένη ερώτηση εντόπισε στο Διαδίκτυο ένα κλειδί προγραμματισμού και το χρησιμοποίησε χωρίς άδεια, σύμφωνα με την OpenAI. Όταν στη συνέχεια δεν κατάφερε να βρει τα αριθμητικά στοιχεία που χρειαζόταν για να απαντήσει στην ερώτηση, τα επινόησε.

Ένα διαφορετικό μοντέλο, το οποίο επίσης δεν είχε διατεθεί στο κοινό, έλυσε σωστά ένα πρόβλημα χρησιμοποιώντας κώδικα και στη συνέχεια ανέβασε χωρίς άδεια δικό του αρχείο στο Διαδίκτυο, ώστε να μπορέσει να ικανοποιήσει αίτημα που απαιτούσε παραπομπή σε διαδικτυακή πηγή.

Σε δύο πρόσθετα περιστατικά, αυτοματοποιημένα συστήματα σχεδίασαν δικούς τους τρόπους επικοινωνίας: Στη μία περίπτωση, χρησιμοποίησαν πλατφόρμα της εταιρείας ως αυτοσχέδιο πίνακα ανακοινώσεων, προκειμένου να ανταλλάσσουν αιτήματα καθώς αναζητούσαν αρχεία που έλειπαν. Σε άλλο συμβάν, συστήματα που εργάζονταν στην ίδια αποστολή στράφηκαν σε δημόσιες υπηρεσίες διαμοιρασμού αρχείων, ώστε να ανταλλάσσουν έγγραφα όταν δεν μπορούσαν να επικοινωνήσουν απευθείας μεταξύ τους.