Invitez et gagnez

Fonctionnement des récompenses

Partagez votre lien. Lorsqu’un ami s’inscrit avec ce lien et recharge son solde, vous recevez la récompense affichée sur ses recharges ultérieures.

GLM 5.3 ou DeepSeek V4 Pro : résultats, durée et coût

Comparer le coût par résultat accepté et le temps de travail, en tenant compte de l'arrêt annoncé de DeepSeek V4 Pro.

Sommaire
GLM 5.3 ou DeepSeek V4 Pro : résultats, durée et coût

Commencez par tester GLM 5.3 si un résultat accepté supplémentaire sur une tâche difficile peut justifier une dépense plus élevée. DeepSeek V4 Pro-0813 mérite une comparaison lorsque le coût des tentatives répétées prime. Dans une évaluation publiée, GLM a terminé davantage de tâches avec une durée médiane plus courte parmi les réussites ; Pro a coûté moins cher. Cela ne désigne pas un vainqueur universel.

Une échéance de disponibilité approche : DeepSeek prévoit d’arrêter V4 Pro le 14 septembre 2026 à 12 h, heure de Pékin, soit 04 h UTC ou 07 h à Moscou. Un avis de la plateforme officielle, visible après connexion, annonce la redirection des requêtes Pro vers V4.1 Flash, facturées aux tarifs de ce dernier. Ne fondez pas une nouvelle intégration durable à l’API officielle sur l’idée que l’ancien nom continuera à servir Pro-0813.

Il est ici question de GLM 5.3 et de Pro-0813, pas de GLM 5.3 Flash ni de V4.1 Flash. Les résultats historiques de Pro peuvent servir de référence pour tester un remplacement ; ils ne décrivent pas le modèle qui répondra sous ce nom après l’arrêt.

Ce que montre l’évaluation de 30 tâches

Le 27 août, Composio a publié un comparatif de cinq modèles sur 30 tâches d’agent à plusieurs étapes :

Mesure de ComposioGLM 5.3DeepSeek V4 Pro-0813
Tâches terminées22 sur 3019 sur 30
Coût total des 30 tâches$5.31$1.23
Coût publié par tâche réussie$0.24$0.065
Durée médiane des tâches terminées2 min 54 s4 min 41 s
Dépassements du délai13

Résultats originaux : réussites, coût total, coût par réussite, durée et délais dépassés.

GLM a terminé trois tâches de plus dans cet échantillon. Le coût par réussite de Pro était environ 3,7 fois plus faible : $0.24 / $0.065. Il s’agit de dépenses historiques de l’évaluation, hors reprise humaine, et non des prix actuels de l’API.

Les médianes ne portent que sur les réussites, dont les ensembles diffèrent entre modèles. Elles ne prouvent ni que GLM est plus rapide sur chaque tâche identique, ni qu’une séance complète se terminera proportionnellement plus tôt. Les échecs et délais dépassés consomment aussi du temps.

Cette évaluation est celle de Composio, pas un test réalisé par nous. Sans paramètres complets, environnement d’exécution et répétitions, 22 contre 19 ne permet pas de prédire fiablement les réussites sur votre projet. Un enchaînement d’outils externes diffère aussi de la correction d’un bug dans un dépôt.

Des résultats de programmation plus contrastés

La fiche officielle de GLM 5.3 inclut Pro-0813 :

Test du tableau de Z.aiGLM 5.3Pro-0813
Terminal Bench 2.188.287.9
DeepSWE v1.166.962.7
NL2Repo58.061.1
Toolathlon Verified73.074.1

GLM mène sur les deux premières lignes, Pro sur les suivantes. Ces chiffres sont publiés par Z.ai dans les conditions précisées sur la fiche ; ils ne remplacent pas un test indépendant dans votre client. Des tâches et méthodes de notation différentes ne s’additionnent pas en un pourcentage unique de qualité.

Les réglages par défaut diffèrent également : GLM 5.3 utilise reasoning_effort = max, tandis que le guide DeepSeek V4 actuel active le raisonnement avec un effort high. Deux exécutions sans réglage ne sont donc pas dans le même mode. Même des noms d’effort identiques ne prouveraient pas des budgets de calcul égaux.

Pour reproduire un benchmark, suivez ses conditions publiées. Pour choisir un modèle de travail, fixez plutôt le coût et la durée acceptables, puis testez des réglages adaptés à chaque modèle dans ces limites.

Compter toutes les tentatives avant acceptation

Définissez d’abord la réussite : pour un correctif, le test auparavant en échec doit passer sans régression ; pour un agent agissant sur plusieurs systèmes, chacun doit atteindre l’état attendu sans enregistrement supplémentaire ni action répétée.

cost_per_accepted_task = total_api_cost_of_all_attempts / accepted_tasks

Incluez au numérateur les échecs, nouvelles tentatives et appels au modèle de secours. Sans tâche acceptée, l’indicateur est indéfini : notez zéro réussite et la dépense totale, pas un coût par réussite nul.

Mesurez séparément le temps humain de contrôle et de correction. Si vous le convertissez en argent, utilisez votre propre coût horaire et distinguez-le des dépenses API. Une longue reprise peut annuler l’économie sur le modèle ; vérifiez-le sur vos tâches.

Le Dashboard BetterToken permet de consulter le modèle, l’heure des requêtes, les tokens d’entrée, de sortie et de cache, ainsi que leur coût. L’acceptation des tâches et l’effort humain exigent des notes séparées. Un nom de modèle dans un journal ne prouve pas indépendamment quels poids un fournisseur externe a servis.

Choisir sur votre charge de travail

Prenez un petit ensemble de tâches récurrentes. Donnez aux deux modèles le même état initial du projet, les mêmes instructions, autorisations d’outils et critères d’acceptation. Employez des données de test pour éviter les doublons réels lors d’actions externes répétées.

Notez versions du modèle et du client, fournisseur, mode de raisonnement, délai et limite de tentatives. Conservez coût et résultat de chaque exécution, y compris les échecs. Comparez les tâches précises résolues par chacun, pas seulement la facture totale.

  • Modifications complexes et reprise humaine coûteuse : testez GLM 5.3 en premier pour voir si les avantages de certaines évaluations produisent davantage de changements acceptés chez vous.
  • Tâches bien délimitées et budget serré : les résultats historiques de Pro-0813 illustrent l’intérêt du coût par réussite. Comparez-le à votre modèle actuel avant l’arrêt ; la poursuite du travail exige une option dont la disponibilité est confirmée.
  • Longs processus avec plusieurs outils : plafonnez la durée totale, tentatives comprises. Les médianes des réussites omettent le temps perdu sur les tâches inachevées.

Après le 14 septembre, une nouvelle requête officielle à deepseek-v4-pro ne constitue pas automatiquement un test de Pro-0813. Vérifiez la redirection : si V4.1 Flash répond, c’est un nouveau comparatif avec GLM 5.3, qui exige de nouveaux résultats. Vérifiez séparément les dates et disponibilités des fournisseurs tiers.

Prêt à optimiser votre workflow LLM ?

Connectez vos modèles via une API unique, gérez les clés et maîtrisez vos dépenses d’IA.

Commencer gratuitement