
Το κινεζικό μοντέλο Τεχνητής Νοημοσύνης Kimi βρέθηκε στο επίκεντρο έρευνας, καθώς ερευνητές υποστηρίζουν ότι κατάφεραν να παρακάμψουν τα ενσωματωμένα μέτρα ασφαλείας του και να το οδηγήσουν σε συζητήσεις για ανάπτυξη βιολογικών όπλων και δολοφονίες.
Τα ευρήματα αφορούν τα μοντέλα Kimi K2.6 και K3 Swarm της κινεζικής εταιρείας Moonshot και εντοπίστηκαν από τη Mindgard, εταιρεία που ειδικεύεται στον έλεγχο της ασφάλειας συστημάτων Τεχνητής Νοημοσύνης.
Η εταιρεία ενημέρωσε τη Moonshot για τα ευρήματά της και στη συνέχεια το ζήτημα τέθηκε υπό εσωτερική διερεύνηση από την κινεζική εταιρεία.
Η δοκιμή έγινε στο πλαίσιο του λεγόμενου «jailbreaking», δηλαδή της προσπάθειας να παρακαμφθούν οι περιορισμοί που έχουν ενσωματωθεί σε ένα μοντέλο ώστε να αποφεύγει επικίνδυνες ή απαγορευμένες απαντήσεις.
Σύμφωνα με τη Mindgard, τα συγκεκριμένα μοντέλα μπορούσαν, μετά την επιτυχή παράκαμψη των δικλίδων ασφαλείας, να ανταποκριθούν σε ένα ευρύ φάσμα επιβλαβών αιτημάτων.
Ο ιδρυτής της εταιρείας, Peter Garraghan, δήλωσε στο BBC ότι το πρόβλημα δεν περιοριζόταν σε ένα συγκεκριμένο θέμα, αλλά μπορούσε να επεκταθεί και σε άλλες επικίνδυνες κατηγορίες.
Η εταιρεία κυβερνοασφάλειας διευκρινίζει πάντως ότι δεν έχει αποδείξει πως οι πληροφορίες που έδωσε το Kimi για τα συγκεκριμένα ζητήματα θα ήταν αποτελεσματικές στην πράξη. Το βασικό εύρημα αφορά την αποτυχία των μηχανισμών προστασίας να αποτρέψουν εξαρχής μια τέτοια συζήτηση.
Η απάντηση της Moonshot
Η Moonshot δήλωσε στο BBC ότι αντιμετωπίζει θετικά την αξιολόγηση από ανεξάρτητους ερευνητές, χαρακτηρίζοντάς την σημαντικό μέρος της προσπάθειας για τη δημιουργία ασφαλέστερων συστημάτων AI.
Η εταιρεία ανέφερε επίσης ότι βρίσκεται σε επικοινωνία με τη Mindgard για τα συγκεκριμένα ευρήματα.
Σύμφωνα με στοιχεία που κοινοποιήθηκαν στο BBC, η Moonshot υποστήριξε ότι στις εσωτερικές αξιολογήσεις της τα μοντέλα εμφάνιζαν γενικά υψηλό ποσοστό άρνησης σε αντίστοιχα αιτήματα.
Το περιστατικό αναδεικνύει ένα ευρύτερο ζήτημα για την ασφάλεια των σύγχρονων μοντέλων AI: το κατά πόσο οι δικλίδες που εμποδίζουν την παραγωγή επικίνδυνου περιεχομένου μπορούν να παραμείνουν αποτελεσματικές όταν οι χρήστες επιχειρούν συστηματικά να τις παρακάμψουν.
Παράλληλα, η περίπτωση του Kimi έρχεται μετά από άλλες δοκιμές που έχουν εξετάσει τις δυνατότητες των μοντέλων της Moonshot σε κυβερνοεπιθέσεις.
Σε προκαταρκτική αξιολόγηση των Kimi K3 από βρετανικούς και αμερικανικούς φορείς κυβερνοασφάλειας, το μοντέλο εμφάνισε δυνατότητες σε δοκιμές ανάπτυξης exploits και σε προσομοιωμένο περιβάλλον κυβερνοεπίθεσης, αν και βρέθηκε χαμηλότερα από τα ισχυρότερα μοντέλα που εξετάστηκαν.
Η Mindgard υποστηρίζει ότι ενημέρωσε τη Moonshot για το ζήτημα στις 27 Ιουλίου, ενώ στη συνέχεια δημοσιοποίησε την έρευνά της χωρίς να αποκαλύψει τις κρίσιμες τεχνικές λεπτομέρειες που θα μπορούσαν να επιτρέψουν την αναπαραγωγή της παράκαμψης των μέτρων ασφαλείας.