GLM-5.3: η Zhipu κερδίζει σε ένα τεστ ασφάλειας και χάνει σε άλλο
Η Zhipu AI κυκλοφόρησε στις 14 Αυγούστου το GLM-5.3, μέσω του GLM Coding Plan. Είναι το ίδιο βασικό μοντέλο με το GLM-5.2, με βελτιώσεις μόνο από post-training (επιπλέον εκπαίδευση πάνω στο έτοιμο μοντέλο).
Όσα νούμερα ακολουθούν είναι της ίδιας της Zhipu, η οποία βαθμολόγησε και τα ανταγωνιστικά μοντέλα. Δεν πρόκειται για ανεξάρτητα benchmarks (τυποποιημένα τεστ σύγκρισης μοντέλων).
Στο Z.ai Code Bench, ιδιωτικό τεστ της εταιρείας, το GLM-5.3 είναι 50% καλύτερο από το GLM-5.2 — όχι στον προγραμματισμό γενικά, σε αυτό το συγκεκριμένο τεστ. Στο CyberGym πήρε 84,5%, έναντι 83,8% του Mythos 5 και 83,6% του GPT-5.6 Sol. Στο ExploitBench όμως μένει πίσω καθαρά: 54,4%, έναντι 78,0% και 76,5% αντίστοιχα. Στο ExploitGym ολοκλήρωσε 105 tasks σε δύο ώρες, έναντι 181 του Mythos 5.
Διατίθεται μέσω GLM Coding Plan/ZCode, χωρίς γνωστή τιμή. Τα open-weights αναμένονται σε δύο περίπου εβδομάδες.
Γιατί έχει σημασία: η Zhipu δημοσιεύει και τα τεστ όπου χάνει, κάτι που δεν κάνουν όλες οι εταιρείες. Η εικόνα παραμένει όμως δική της μέχρι να μετρήσουν τρίτοι.
Σχόλια
Συνδέσου για να σχολιάσεις
Σύνδεση