
Σοβαρά κενά ασφαλείας σε δημοφιλή συστήματα τεχνητής νοημοσύνης έφερε στο φως η πρόσφατη έρευνα που απέδειξε πως οι μηχανισμοί προστασίας μπορούν να καταρρεύσουν. Συγκεκριμένα, δύο γνωστά μοντέλα της κινεζικής εταιρείας Moonshot παραβιάστηκαν από ερευνητές, οι οποίοι κατάφεραν να αποσπάσουν καθοδήγηση σχετικά με την παραγωγή βιολογικών όπλων, αλλά και λεπτομέρειες για την εκτέλεση δολοφονιών. Το γεγονός αυτό οδήγησε την κατασκευάστρια εταιρεία να ξεκινήσει άμεσα εσωτερική έρευνα για το ζήτημα.
Τα ανησυχητικά ευρήματα ήρθαν στο φως από την εταιρεία Mindgard, η οποία επικεντρώνεται στον έλεγχο ασφαλείας των συστημάτων τεχνητής νοημοσύνης. Οι ειδικοί της εταιρείας ανακάλυψαν τον περασμένο Ιούλιο πως μέσω της μεθόδου του jailbreaking, τα μοντέλα Kimi K2.6 και K3 Swarm είναι σε θέση να αψηφήσουν τους αυστηρούς περιορισμούς που έχουν σχεδιαστεί ακριβώς για να εμποδίζουν την παροχή τόσο επικίνδυνων πληροφοριών.
Από την πλευρά της, η Moonshot, απαντώντας στο BBC, υπογράμμισε ότι αντιμετωπίζει τη συνδρομή εξωτερικών φορέων ως «βασικό πυλώνα για την ανάπτυξη καλύτερης και ασφαλέστερης τεχνητής νοημοσύνης». Επιπλέον, ξεκαθάρισε ότι βρίσκεται ήδη σε ανοιχτή επικοινωνία με τη Mindgard για να εξετάσει σε βάθος τα συγκεκριμένα στοιχεία.
Μιλώντας στην εκπομπή Tech Life του BBC World Service, ο επικεφαλής της Mindgard, Πίτερ Γκάραχαν, εξέφρασε τον έντονο προβληματισμό του για τη συμπεριφορά των Kimi K2.6 και K3 Swarm. Όπως σημείωσε χαρακτηριστικά, «Μόλις λειτουργήσει το jailbreak, θα μιλήσουν για οποιοδήποτε θέμα. Θα παρέχουν ακόμα και συστάσεις για άλλα θέματα που είναι επίσης κακόβουλα και θα είναι ευρηματικό και δημιουργικό».
Ο ρόλος και οι κίνδυνοι των jailbreaks
Η διαδικασία του jailbreak δημιουργεί εντελώς διαφορετικές απειλές συγκριτικά με τα πρόσφατα περιστατικά που έχουν απασχολήσει τον τομέα της τεχνητής νοημοσύνης. Σε παλαιότερες περιπτώσεις, αυτόνομα συστήματα, τα οποία ονομάζονται agents και δημιουργήθηκαν από αμερικανικούς κολοσσούς όπως η OpenAI, η Meta και η Anthropic, παραβίασαν διάφορες διαδικτυακές πλατφόρμες.
Αν και οι πρακτικές παράκαμψης των δικλείδων ασφαλείας είναι εξαιρετικά περίπλοκες και απαιτούν επιμονή, αρκετοί αναλυτές εκφράζουν φόβους. Η βασική ανησυχία είναι ότι κακόβουλοι χρήστες και χάκερ ενδέχεται να εκμεταλλευτούν τέτοιες τεχνικές για να προκαλέσουν σημαντικές ζημιές.
Πρόσφατα, μάλιστα, η Anthropic γνωστοποίησε ότι σταμάτησε προσπάθειες εκμετάλλευσης ενός μοντέλου της για «κακόβουλη δραστηριότητα», η οποία ενδεχομένως να σχετιζόταν με την ανάπτυξη βιολογικών απειλών.
Ενδεχόμενος δούρειος ίππος για κυβερνοεπιθέσεις
Η εταιρεία Mindgard δεν έχει επιβεβαιώσει εάν οι απαντήσεις που παρήγαγε το Kimi σε αυτά τα ακραία σενάρια θα μπορούσαν να εφαρμοστούν με επιτυχία στον πραγματικό κόσμο. Ωστόσο, τόνισε πως οι μηχανισμοί προστασίας όφειλαν να έχουν μπλοκάρει εξ αρχής τη συμμετοχή των μοντέλων σε συζητήσεις γύρω από τέτοια ζητήματα με τους χρήστες.
Παράλληλα, οι ερευνητές δηλώνουν σίγουροι πως αν οι περιορισμοί ενός Kimi 2.6 αρθούν, οι χάκερ θα μπορούσαν να τρέξουν δικό τους κώδικα στα συστήματά του και να αποκτήσουν πρόσβαση στο διαδίκτυο. Μια τέτοια εξέλιξη θα μπορούσε να μετατρέψει το AI σε κέντρο ελέγχου για ψηφιακές επιθέσεις.
Ο Πίτερ Γκάραχαν υπεραμύνθηκε της επιλογής της Mindgard να μιλήσει ανοιχτά για το jailbreak στα μοντέλα της Moonshot. Εξήγησε ότι η κατασκευάστρια είχε ήδη λάβει γνώση, ενώ επισήμανε πως δεν έχουν δημοσιοποιηθεί κρίσιμες τεχνικές λεπτομέρειες για τον τρόπο με τον οποίο ακυρώθηκαν τα μέτρα προστασίας.
Η αρχική ενημέρωση προς τη Moonshot έγινε μέσω ηλεκτρονικού ταχυδρομείου στις 27 Ιουλίου, ενώ ακολούθησε και δεύτερη επικοινωνία μια εβδομάδα αργότερα. Το σχετικό κείμενο αναρτήθηκε στο ιστολόγιο της εταιρείας ασφαλείας στις 12 Σεπτεμβρίου.
Παρ’ όλα αυτά, η Mindgard αναφέρει ότι η πρώτη επαφή από την πλευρά της Moonshot έγινε πολύ πρόσφατα, και συγκεκριμένα όταν το BBC ζήτησε επίσημη τοποθέτηση. Σε ένα τμήμα του email που εστάλη προς τη Mindgard, το οποίο η Moonshot έδειξε και στο βρετανικό δίκτυο, σημειωνόταν πως κατά τις εσωτερικές δοκιμές, το σύστημα παρουσίαζε «υψηλό ποσοστό άρνησης σε αιτήματα αυτού του τύπου».
Η τεράστια πρόκληση της ασφάλειας
Αυτές οι αποκαλύψεις έρχονται σε μια χρονική συγκυρία όπου η κοινότητα της τεχνητής νοημοσύνης διαφωνεί έντονα. Το βασικό ερώτημα είναι αν τα κλειστά συστήματα, όπως το ChatGPT και το Claude της Anthropic, είναι πιο ασφαλή από τα εργαλεία ανοικτού κώδικα.
Αξίζει να σημειωθεί ότι το Kimi αποτελεί ένα μοντέλο ανοικτών βαρών (open-weight), γεγονός που επιτρέπει σε οποιονδήποτε να το κατεβάσει και να το χρησιμοποιήσει στη δική του υποδομή.
Ο καθηγητής του Πανεπιστημίου του Surrey, Άλαν Γούντγουορντ, ανέφερε στο BBC πως υπάρχει ορατός κίνδυνος τα συστήματα ανοικτού κώδικα να περάσουν σε λάθος χέρια. Ωστόσο, διευκρίνισε ότι μπορούν επίσης να φανούν χρήσιμα στην άμυνα απέναντι σε ψηφιακές απειλές. Ανέφερε μάλιστα το παράδειγμα της Hugging Face, η οποία επιστράτευσε ένα κινεζικό μοντέλο ανοικτού κώδικα για να αναλύσει μια κυβερνοεπίθεση. Όπως διαπιστώθηκε αργότερα, η επίθεση αυτή είχε οργανωθεί από αυτόνομα συστήματα (agents) της OpenAI.
Ο καθηγητής Γούντγουορντ εμφανίστηκε απαισιόδοξος για τη δημιουργία ενός παγκόσμιου κανονιστικού πλαισίου που θα προλαβαίνει τις εξελίξεις. «Μας πήρε δεκαετίες για να συμφωνήσουμε στη μορφή των τηλεφωνικών αριθμών», δήλωσε με νόημα.
Στο ίδιο μήκος κύματος με τον ιδρυτή της Mindgard, ο καθηγητής Γούντγουορντ κατέληξε στο συμπέρασμα πως η προσοχή θα πρέπει να στραφεί πρωτίστως στον εντοπισμό και τη νομική τιμωρία όσων χρησιμοποιούν κακόβουλα την τεχνητή νοημοσύνη.