Ανεξάρτητη Αξιολόγηση Μοντέλων

Frontier AI Benchmarks & Σύγκριση

Συνεχής παρακολούθηση και αντικειμενική μέτρηση των κορυφαίων μοντέλων τεχνητής νοημοσύνης σε ποιότητα συλλογιστικής, ταχύτητα παραγωγής (tokens/sec) και πραγματικό κόστος χρήσης ανά 1 εκατομμύριο tokens.

Ευφυΐα & Benchmarks

Πίνακας Αξιολόγησης Frontier AI Μοντέλων

Συγκριτική ανάλυση ποιότητας, κώδικα, ταχύτητας και κόστους ανά 1M tokens.

# Μοντέλο
Δείκτης Ποιότητας
Κώδικας
Κόστος / 1M
1
Claude Fable 5
Anthropic
98.4
84.8%
$90.00
in: $18.00
2
Claude Opus 5 (max)
Anthropic
97.8
83.5%
$75.00
in: $15.00
3
GPT-5.6 Sol (max)
OpenAI
97.5
84.2%
$48.00
in: $12.00
4
Grok 4.6 (high)
xAI
96.9
81.8%
$20.00
in: $5.00
5
Kimi K3 (max)
Moonshot AI
96.5
80.5%
$16.00
in: $4.00
6
GLM-5.3
Zhipu AIOpen Weights
96.2
79.8%
$2.00
in: $0.50
7
GPT-5.6 Terra (max)
OpenAI
96
82.8%
$24.00
in: $6.00
8
Stealth Ox Alpha
Anonymous
95.8
81.4%
$0.00
in: $0.00
9
DeepSeek V4-Pro
DeepSeekOpen Weights
95.5
78.5%
$1.10
in: $0.28
10
Gemini 3.7 Flash
Google DeepMind
94.2
75.1%
$0.40
in: $0.10

Αναλυτικά Χαρακτηριστικά Μοντέλων

AnthropicScore: 98.4/100

Claude Fable 5

Η κορυφαία ναυαρχίδα της Anthropic στην κορυφή του Artificial Analysis Intelligence Index με προσαρμοστική συλλογιστική.

#1 στο Artificial Analysis Intelligence Index με προσαρμοστική σκέψη
Κορυφαία επίδοση στο benchmark αποφυγής ψευδαισθήσεων AA-Omniscience
Δυναμικός μηχανισμός ασφαλείας με δρομολόγηση στο Claude Opus
Context Window
1000k tokens
Output Price
$90/1M
AnthropicScore: 97.8/100

Claude Opus 5 (max)

Ο ηγέτης στην αυτόνομη επιχειρησιακή εργασία, #1 στο benchmark AA-Briefcase.

#1 στο benchmark AA-Briefcase για πολύωρη αυτόνομη εργασία
500.000 tokens συνεχούς σκέψης για πλήρη αποθετήρια κώδικα
Απαράμιλλη ακρίβεια σε νομικές, ιατρικές και επιστημονικές αναλύσεις
Context Window
500k tokens
Output Price
$75/1M
OpenAIScore: 97.5/100

GPT-5.6 Sol (max)

Η ναυαρχίδα GPT-5.6 της OpenAI, #1 στο Artificial Analysis Coding Agent Index με παράθυρο 1M tokens.

#1 στο Artificial Analysis Coding Agent Index σε σύνθετα αποθετήρια
Παράθυρο 1.000.000 tokens με εγγενή κλιμάκωση χρόνου σκέψης
Αυτόνομη εκτέλεση σε απομονωμένο περιβάλλον Python
Context Window
1000k tokens
Output Price
$48/1M
xAIScore: 96.9/100

Grok 4.6 (high)

Το νέο κορυφαίο μοντέλο της xAI εκπαιδευμένο στο cluster Colossus, στην 3η θέση του Intelligence Index.

Στην 3η θέση του Artificial Analysis Intelligence Index v4.1.1
Συλλογιστική εξαιρετικά χαμηλής καθυστέρησης μέσω Colossus
Εγγενής αναζήτηση πραγματικού χρόνου και ανάλυση βίντεο
Context Window
500k tokens
Output Price
$20/1M
Moonshot AIScore: 96.5/100

Kimi K3 (max)

Το γιγάντιο MoE μοντέλο 2.8 τρισ. παραμέτρων της Moonshot AI στις κορυφαίες 5 θέσεις του Intelligence Index.

2.8 τρισεκατομμύρια παράμετροι με προηγμένη ενισχυτική μάθηση
Στις 5 κορυφαίες θέσεις του παγκόσμιου Intelligence Index
Παράθυρο 1M tokens για επιστημονικούς agents μακράς διάρκειας
Context Window
1000k tokens
Output Price
$16/1M
Zhipu AIScore: 96.2/100

GLM-5.3

Αναβαθμισμένο μοντέλο συλλογιστικής της Zhipu AI στο Artificial Analysis Index με σκορ 60 και 1M context.

Σκορ 60 στο Artificial Analysis Intelligence Index v4.1.1
Παράθυρο 1.048.576 tokens με εξειδίκευση στην κυβερνοασφάλεια
Ανοιχτά βάρη προγραμματισμένα για διάθεση στα τέλη Αυγούστου
Context Window
1049k tokens
Output Price
$2/1M
AnonymousScore: 95.8/100

Stealth Ox Alpha

Μυστηριώδες μοντέλο συλλογιστικής με 1M context και 131K tokens εξόδου. Αποδίδεται στη σειρά GLM-5.3 της Zhipu AI.

Τεράστιο context 1M tokens με 131K μέγιστη συνεχή παραγωγή tokens
Επιτυγχάνει 81.4% Pass@1 στο benchmark DeepSWE για προγραμματισμό
Εγγενής επεξεργασία βίντεο και εγγράφων υψηλής ανάλυσης
Context Window
1049k tokens
Output Price
$0/1M
OpenAIScore: 96/100

GPT-5.6 Terra (max)

Η οικονομική έκδοση της σειράς GPT-5.6 της OpenAI με κορυφαία νοημοσύνη στο μισό κόστος.

Ισάξιο με το GPT-5.6 Sol στον κώδικα στο 50% της τιμής
Πλήρες παράθυρο 1.000.000 tokens για μεγάλα projects
Ταχύτατη απόκριση κάτω των 350ms
Context Window
1000k tokens
Output Price
$24/1M
DeepSeekScore: 95.5/100

DeepSeek V4-Pro

Αρχιτεκτονική MoE 1.6 τρισ. παραμέτρων με επικάλυψη επικοινωνίας DualPipe v2 και εξαιρετικά χαμηλή τιμή ανά token.

1.6T συνολικές παράμετροι με 128B ενεργές ανά token
Το DualPipe v2 εξαλείφει τις καθυστερήσεις δικτύου GPU
Πλήρη ανοιχτά βάρη με εμπορική άδεια στο Hugging Face
Context Window
1000k tokens
Output Price
$1.1/1M
Google DeepMindScore: 94.2/100

Gemini 3.7 Flash

Το παραγωγικό μοντέλο υψηλής ταχύτητας της Google για live audio και video streaming σε πραγματικό χρόνο.

Ταχύτητα 175 tokens/sec για άμεση παραγωγή κειμένου
Καθυστέρηση κάτω των 150ms για ζωντανές συνομιλίες
Παράθυρο 1M tokens με κόστος μόλις $0.10 / $0.40
Context Window
1000k tokens
Output Price
$0.4/1M