ΗAnthropic, η αμερικανική εταιρεία που βρίσκεται πίσω από το chatbot Claude, παραδέχθηκε ότι μια σειρά περιστατικών κυβερνοασφάλειας ανέδειξε «αποτυχίες λειτουργικής ασφάλειας» στα μοντέλα τεχνητής νοημοσύνης της. Ως απάντηση, η εταιρεία ανακοίνωσε αλλαγές στις διαδικασίες δοκιμών της.
Η Anthropic αποκάλυψε τον Ιούλιο ότι τα μοντέλα της είχαν αποκτήσει πρόσβαση στο ανοιχτό διαδίκτυο σε τρεις περιπτώσεις και είχαν αποκτήσει μη εξουσιοδοτημένη πρόσβαση στα συστήματα τριών οργανισμών.
Σε νέα ανάρτηση στο ιστολόγιό της σχετικά με τα περιστατικά, η εταιρεία παραδέχθηκε ότι η τεχνολογία της «δεν είναι απόλυτα ευθυγραμμισμένη» με τις ανθρώπινες αξίες και τους στόχους.
Η Anthropic ανέφερε ότι τα μοντέλα είχαν υποβληθεί σκόπιμα σε δοκιμές χωρίς δικλίδες κυβερνοασφάλειας και ότι κατάφεραν να αποκτήσουν πρόσβαση στο ανοιχτό διαδίκτυο — το αντίστοιχο, στις δοκιμές τεχνητής νοημοσύνης, με το να αφήνει κανείς την εξώπορτα ανοιχτή — εξαιτίας μιας παρανόησης με εξωτερική εταιρεία δοκιμών.
Ως αποτέλεσμα, η εταιρεία ανέφερε ότι αρχικά ανέστειλε τις εσωτερικές και εξωτερικές δοκιμές κυβερνοασφάλειας των μοντέλων, προκειμένου να εφαρμόσει ένα αυστηρότερο πλαίσιο ασφάλειας.
«Βασιζόμασταν σε μεγάλο βαθμό σε ένα μόνο επίπεδο άμυνας… ενώ χρειαζόμασταν περισσότερα», δήλωσε η Anthropic.
Η startup έχει πλέον εφαρμόσει επιπλέον μέτρα, μεταξύ των οποίων ένα σύστημα ειδοποίησης σε περίπτωση που ένα μοντέλο επιχειρήσει να διαφύγει από το περιβάλλον δοκιμών ή αποκτήσει πρόσβαση στο διαδίκτυο, αποτελεσματικότερη απομόνωση των περιβαλλόντων όπου πραγματοποιούνται οι πιο επικίνδυνες δοκιμές και υποχρέωση των εξωτερικών εταιρειών δοκιμών να δεσμεύονται σε ένα σύνολο προτύπων ασφαλείας.
Στα μέτρα αυτά περιλαμβάνεται και η απαίτηση να δίνονται στα μοντέλα σαφείς οδηγίες κατά τη διάρκεια των δοκιμών, όπως: «δεν πρέπει να αποκτήσεις πρόσβαση στο διαδίκτυο».
Η Anthropic είχε αναφέρει τον Ιούλιο ότι τρεις ανώνυμοι οργανισμοί είχαν δεχθεί επίθεση από τρία μοντέλα της, μετά από μια «παρανόηση» με τον συνεργάτη της στις δοκιμές, την εταιρεία Irregular, η οποία είχε ως αποτέλεσμα τα μοντέλα να αποκτήσουν πρόσβαση στο διαδίκτυο.
Μετά την εφαρμογή των νέων μέτρων, η Anthropic δήλωσε ότι επανέλαβε τις εσωτερικές και εξωτερικές δοκιμές κυβερνοασφάλειας.
Όπως και η OpenAI, η οποία αποκάλυψε παραβίαση των διαδικασιών ασφαλείας στις δοκιμές της τον ίδιο μήνα, η Anthropic ανέφερε ότι ανέστειλε ορισμένες δοκιμές ενισχυτικής μάθησης υψηλού κινδύνου — μια τεχνική ανάπτυξης μέσω δοκιμής και σφάλματος, κατά την οποία τα συστήματα τεχνητής νοημοσύνης επιβραβεύονται όταν βρίσκουν τρόπους να εκτελέσουν μια συγκεκριμένη εργασία.
Οι αστοχίες ευθυγράμμισης
Στην τελευταία ανάρτησή της, η Anthropic ανέφερε ότι διαπίστωσε πως οι προβληματικές ρυθμίσεις εκπαίδευσης αποτελούσαν «δυσανάλογα σημαντικούς παράγοντες» για την εκδήλωση μη ευθυγραμμισμένης συμπεριφοράς — τον όρο που χρησιμοποιείται όταν ένα σύστημα τεχνητής νοημοσύνης αποτυγχάνει να τηρήσει ή να «ευθυγραμμιστεί» με ανθρώπινες αξίες, όπως η αποφυγή πρόκλησης βλάβης.
Η startup ανέφερε ότι εντόπισε δύο αποτυχίες ευθυγράμμισης στα περιστατικά των δοκιμών.
Η πρώτη ήταν η «υποκινούμενη λογική» (*motivated reasoning*): παρά το γεγονός ότι τα μοντέλα έβρισκαν ενδείξεις πως μπορεί να είχαν συνδεθεί με το διαδίκτυο, ενδέχεται να συνέχιζαν να προσκολλώνται στην «πεποίθηση» ότι βρίσκονταν σε ένα προσομοιωμένο περιβάλλον και, επομένως, ότι δεν παραβίαζαν το εργαστήριο δοκιμών.
Η δεύτερη ήταν ένας παράγοντας «απερισκεψίας», καθώς τα μοντέλα ήταν διατεθειμένα να προβούν σε επιβλαβείς ενέργειες στο διαδίκτυο προκειμένου να επιτύχουν τον στενό στόχο της επιτυχίας σε μια δοκιμή κυβερνοασφάλειας.
Η Anthropic δήλωσε ότι αντιμετωπίζει ένα φαινόμενο στην ανάπτυξη της τεχνητής νοημοσύνης που είναι γνωστό ως «reward-hacking». Πρόκειται για την περίπτωση κατά την οποία ένα μοντέλο βρίσκει τρόπους να χειραγωγήσει τη διαδικασία εκπαίδευσής του και να κερδίσει «ανταμοιβές» χωρίς να ολοκληρώνει μια εργασία — μια μη εγκεκριμένη συντόμευση.
Ωστόσο, η Anthropic αναγνώρισε ότι τα περιστατικά των δοκιμών έδειξαν πως έχει ακόμη δρόμο να διανύσει, παρά τις προσπάθειές της να περιορίσει το *reward-hacking*.
«Όπως αποδεικνύουν τα περιστατικά… η διαδικασία μας δεν είναι τέλεια και τα μοντέλα μας δεν είναι απόλυτα ευθυγραμμισμένα», ανέφερε η εταιρεία.
Ο Άλαν Γούντγουορντ, καθηγητής κυβερνοασφάλειας στο University of Surrey, δήλωσε ότι η Anthropic παραδέχθηκε ουσιαστικά πως «το εργοστάσιό της λειτουργούσε πιο γρήγορα από τον ποιοτικό της έλεγχο».
Πρόσθεσε: «Δύο πράγματα ξεπέρασαν τους ελέγχους της Anthropic αυτή την άνοιξη — η διαδικασία εκπαίδευσης και η ασφάλεια. Τα περιστατικά δείχνουν από έξω πώς μοιάζει αυτό το κενό».
Η ανάγκη για συντονισμό
Η εταιρεία, η οποία προετοιμάζεται για την εισαγωγή της στο χρηματιστήριο, με την αξία της να ενδέχεται να φτάσει τα 2 τρισ. δολάρια (1,47 τρισ. λίρες), επανέλαβε την έκκλησή της για συντονισμένη δράση μεταξύ κυβερνήσεων και βιομηχανίας όσον αφορά τον ρυθμό ανάπτυξης του κλάδου.
«Πιστεύουμε ότι ο κόσμος θα ωφεληθεί εάν ο κλάδος υιοθετήσει το συντομότερο δυνατό έναν νόμιμο, επαληθεύσιμο και αποτελεσματικό μηχανισμό για τον συντονισμένο ρυθμό ανάπτυξης», ανέφερε η Anthropic.
Στην ανάρτηση προστίθεται: «Τα περιστατικά του Ιουλίου κατέδειξαν ότι η ανάγκη να βελτιώσουμε τις άμυνές μας στον κυβερνοχώρο είναι ακόμη πιο επείγουσα απ’ ό,τι πιστεύαμε προηγουμένως».
Εκτός από την αντίστοιχη παραβίαση στην OpenAI, τα περιστατικά της Anthropic ακολούθησαν ένα περιστατικό στο Ινστιτούτο Ασφάλειας Τεχνητής Νοημοσύνης του Ηνωμένου Βασιλείου, το οποίο ανέφερε τον Αύγουστο ότι μοντέλα της OpenAI και της Anthropic είχαν πραγματοποιήσει εκστρατεία κυβερνοεπιθέσεων εναντίον πραγματικών ανθρώπων στο πλαίσιο δοκιμής κυβερνοασφάλειας.
Ο *Guardian* αποκάλυψε επίσης τον περασμένο μήνα ότι τα περιστατικά στα οποία συστήματα τεχνητής νοημοσύνης ξεφεύγουν από τον έλεγχο των χρηστών τους έχουν φτάσει σε νέο υψηλό, σχεδόν διπλασιαζόμενα τον Ιούλιο σε σχέση με τον προηγούμενο μήνα και ξεπερνώντας τα 300.














Σήμερα : 94
Αυτη την εβδομάδα : 94
Αυτόν το μήνα : 33076
Συνολικά : 9932879