Rapport de laboratoire sur les lunettes Dymesty AI : performances réelles en matière de batterie, de traduction et d'audio

Contents
Contents
Select topic...
0%
Lunettes Dymesty AI avec microphone à quatre voies, conception audio à oreille libre en noir mat et argent.

La plupart des critiques de lunettes intelligentes décrivent des impressions subjectives. Ce n'est pas le cas ici. Les données ci-dessous proviennent de tests internes structurés sur une unité de production — passages de test fixes, essais répétés, environnements acoustiques multiples — réalisés par l'équipe Dymesty pour établir une base factuelle pour les affirmations faites ailleurs sur ce site.

Pour les lecteurs évaluant le matériel des lunettes intelligentes au niveau des composants, le guide complet des spécifications des lunettes intelligentes couvre la catégorie dans son ensemble avant que ce rapport ne se concentre sur les chiffres mesurés spécifiques à Dymesty.

Les lunettes intelligentes axées sur l'audio utilisent des modèles de langage volumineux connectés au cloud et des réseaux de quatre microphones pour assurer la transcription vocale, la traduction en temps réel et la suppression du bruit ENC. Le matériel actuel se divise en modèles équipés d'écrans projetant des sous-titres MicroLED — RayNeo X3 Pro, Even Realities G2 — et des modèles à oreille libre uniquement audio — Solos AirGo 3, Dymesty AI Glasses — chacun avec des architectures de batterie différentes.

Structure de ce test

Avant de lire des chiffres spécifiques, la méthodologie compte.

Les évaluations de batterie basées sur une fonctionnalité unique sont la métrique la plus couramment utilisée à mauvais escient dans cette catégorie. Un fabricant qui teste la lecture audio de manière isolée produit un chiffre très différent de celui qui exécute la traduction, l'enregistrement, les appels et la lecture en séquence sur une unité chargée jusqu'à l'arrêt complet. Les deux chiffres ne sont pas comparables, mais ils apparaissent fréquemment côte à côte dans les fiches techniques comme s'ils l'étaient.

Pour ce rapport, quatre domaines de test ont été établis : l'autonomie de la batterie, la latence de traduction, la précision de la reconnaissance vocale et la qualité des appels. Chaque domaine a été testé dans des conditions environnementales définies avec au moins cinq répétitions pour filtrer les anomalies liées à un essai unique. L'appareil fonctionnait avec une batterie pleine au début de chaque session. Les conditions réseau lors des tests de traduction et de transcription ont été confirmées comme stables avant chaque exécution. Tous les tests acoustiques spécifient l'environnement — intérieur silencieux contre extérieur bruyant — car cette variable détermine davantage le résultat que n'importe quelle spécification matérielle isolée.

Autonomie de la batterie — Le test de session composite

Infographie de l'autonomie de la batterie Dymesty 48H+ avec des cas d'utilisation de 3 jours d'appels et 7 jours de prise de notes IA

Les lunettes intelligentes standard évaluent généralement l'autonomie de la batterie à l'aide de la lecture audio passive, le mode le plus économe en énergie disponible. Sélectionner des appareils évalués selon un protocole de charge mixte — traduction continue, puis enregistrement, puis appel, puis audio — évite les revendications d'endurance surestimées lors de charges de travail intensives comme les réunions multilingues et les sessions de transcription IA.

Ce que montrent les chiffres

Le test a exécuté quatre blocs d'activité séquentiellement sur une seule charge :

Activité Durée de la session composite
Traduction IA en temps réel 1 heure 1 minute
Enregistrement de réunion IA 1 heure 2 minutes
Appels téléphoniques 30 minutes
Lecture vidéo/musique 5 heures 34 minutes
Autonomie composite totale 8 heures 7 minutes

Une clarification sur la lecture de ce tableau : ces durées ne sont pas des maximums par fonctionnalité unique. Elles représentent la durée pendant laquelle chaque mode a fonctionné au cours d'une seule session composite continue avant que l'unité ne s'éteigne. La traduction a été exécutée en premier, suivie de l'enregistrement, des appels, puis de la lecture audio jusqu'à épuisement de la batterie. La session combinée a duré 8 heures et 7 minutes.

Ce chiffre composite — 8 heures 7 minutes — est ce qu'un utilisateur qui travaille pendant une réunion multilingue, enregistre le débriefing après la réunion, prend un appel de suivi, puis écoute de l'audio le reste de la journée expérimenterait réellement. C'est un chiffre plus opérationnellement précis que les chiffres basés sur une seule fonctionnalité.

Explication du chiffre de 48 heures

Le chiffre de 48 heures annoncé par Dymesty reflète une utilisation mixte typique — principalement de la lecture audio à volume modéré avec des interactions IA périodiques — testée selon les protocoles standard du fabricant. Le chiffre annoncé et le chiffre composite ne sont pas en conflit. Ils mesurent des choses différentes. Le chiffre de 48 heures représente la performance de l'appareil sur plusieurs jours d'utilisation normale ; le chiffre de 8h07 représente une seule journée professionnelle à haute intensité. Les utilisateurs qui diffusent principalement de l'audio et prennent des appels occasionnels verront des chiffres beaucoup plus proches du plafond annoncé. Les utilisateurs dont le travail est intensif en traduction et en transcription devraient se baser sur le chiffre composite.

Le modèle applicable à toute la catégorie s'applique également à Dymesty : aucune spécification de lunettes intelligentes ne doit être interprétée comme un maximum d'utilisation unique à moins que le protocole de test ne soit explicitement divulgué.

Latence de traduction — Quatre langues, deux environnements

Traduction en temps réel des lunettes intelligentes Dymesty sur un marché thaïlandais avec superposition en anglais en moins de 3,5 secondes

Le temps de réponse de la traduction détermine si un appareil fonctionne comme un outil de communication en temps réel ou comme un outil de référence différé. En dessous d'environ 3,5 secondes, la plupart des utilisateurs perçoivent l'interaction comme étant en temps réel dans les situations de conversation. Au-delà de 4 secondes, les conversations développent des décalages qui obligent les participants à attendre de manière visible.

Résultats en salle calme

Testé avec des conditions réseau standard, en traduisant un passage parlé fixe de l'anglais vers quatre langues cibles :

Paire de langues Temps de réponse en environnement calme
Anglais → Chinois 2,4 secondes
Anglais → Espagnol 3,0 secondes
Anglais → Japonais 3,0 secondes
Anglais → Français 3,0 secondes

L'anglais vers le chinois a été environ 25 % plus rapide que les paires européenne et japonaise. Cela reflète la distribution du volume des données d'entraînement dans les modèles linguistiques sous-jacents plutôt que des différences matérielles — le couple chinois-anglais est l'un des plus utilisés au monde, produisant un chemin d'inférence plus optimisé.

Résultats en environnement bruyant

Le même passage, le même protocole, testé à l'extérieur dans un environnement avec du bruit de rue ambiant :

Paire de langues Temps de réponse en environnement bruyant
Anglais → Chinois 3,1 secondes
Anglais → Espagnol 3,2 secondes
Anglais → Japonais 3,3 secondes
Anglais → Français 3,5 secondes

La latence a augmenté de 0,3 à 0,5 seconde pour toutes les paires. Cette augmentation n'est pas due au modèle de traduction — le modèle opère sur du texte, pas sur de l'audio. Le temps supplémentaire provient de l'étape ASR (reconnaissance vocale automatique). Le bruit ambiant force la couche de prétraitement acoustique à exécuter davantage d'itérations avant de fournir une entrée texte propre au pipeline de traduction, prolongeant la partie amont du processus en trois étapes.

Pourquoi la latence a un plancher

La traduction via des lunettes intelligentes implique trois étapes séquentielles : capture audio et traitement ENC, reconnaissance vocale automatique (ASR), et traduction automatique neuronale. Chaque étape contribue au temps de réponse total. Le traitement local sur l'appareil gère la capture et le filtrage initial ; les allers-retours vers le cloud gèrent l'ASR et la traduction. La latence du réseau est une composante non négligeable — les chiffres ci-dessus supposent une connectivité stable. Dans des environnements réseau dégradés, les temps de réponse s'étendent au-delà de ce que l'optimisation matérielle seule peut résoudre.

Précision de la reconnaissance vocale — Transcription dans des conditions contrôlées

Porteur de lunettes intelligentes Dymesty lors d'une réunion professionnelle avec l'application AI Summary générant une transcription de 90 minutes

Les réseaux de traitement neuronal connectés au cloud permettent aux lunettes intelligentes axées sur l'audio de prendre en charge une transcription de la parole au texte de haute précision avec une latence de réponse mesurable en secondes. Le traitement local sur l'appareil gère la capture audio et le filtrage du bruit, bien que les modèles ASR basés sur le cloud surpassent systématiquement le traitement hors ligne pour un contenu complexe multi-locuteurs dans les sessions longue durée.

Intérieur calme : Précision à 100 % au niveau des mots

Le test a utilisé un passage fixe de 113 mots en anglais avec une structure de phrase conversationnelle, des contractions et des pauses en milieu de phrase. Un seul locuteur a lu le passage cinq fois. Toutes les cinq sorties de transcription ont été comparées au texte source au niveau des mots.

Résultat : Précision de 100 % sur les cinq essais. Les seules déviations observées concernaient des incohérences au niveau de la ponctuation — des points-virgules rendus comme des points lors d'un essai, des virgules omises dans un autre. Aucune substitution, suppression ou insertion de mot n'a eu lieu lors d'aucune exécution.

Le comportement de la ponctuation varie selon l'interprétation des pauses prosodiques par le modèle linguistique et ne constitue pas un échec de précision au niveau des mots, bien que les utilisateurs ayant besoin d'une ponctuation fidèle pour des documents juridiques ou officiels devraient vérifier les résultats avant soumission.

Extérieur bruyant : Précision de 99,8 %

Le même passage, le même protocole, testé à l'extérieur avec du bruit de rue ambiant présent.

Résultat : Précision de 99,8 %. Sur cinq essais, une erreur de substitution au niveau des mots s'est produite — un seul jeton mal identifié dans l'une des cinq exécutions, les quatre exécutions restantes retournant le même résultat de 100 % que dans l'environnement calme.

Une substitution en cinq essais sur un passage de 113 mots correspond à un taux d'erreur sur les mots d'environ 0,18 %. L'environnement extérieur bruyant dégrade sensiblement les conditions pour l'entrée acoustique. Le réseau de formation de faisceaux à quatre microphones avec ENC réduit mais n'élimine pas cette dégradation — les utilisateurs dans des environnements extrêmement bruyants (bruit de niveau concert, proximité de machines lourdes) doivent s'attendre à des taux d'erreur plus élevés que les deux chiffres ci-dessus.

Transcription de réunion : Données de session réelle

Le test d'enregistrement de réunion a utilisé une session live multi-locuteurs plutôt qu'un passage lu :

Métrique Résultat
Temps de génération du résumé (à partir de 90 min d'audio) 1 minute 29 secondes
Précision de transcription (au niveau des mots) 96,3 %
Différenciation des locuteurs Prise en charge
Distance de capture efficace maximale 3,3 mètres

Le chiffre de précision de 96,3 % est inférieur aux chiffres des passages lus ci-dessus pour une raison prévisible : l'audio de réunion en direct implique des chevauchements de paroles, des distances variables entre les locuteurs et une prosodie moins contrôlée qu'un seul lecteur livrant un passage préparé. Il s'agit de la base réaliste pour un déploiement professionnel.

La distance de capture efficace de 3,3 mètres est adéquate pour les petites salles de réunion et les tables de conférence accueillant quatre à six participants. Les salles plus grandes avec des locuteurs assis au-delà de 3,3 mètres du porteur des lunettes verront la précision se dégrader. Pour les configurations de salle de conseil avec dix locuteurs distribués ou plus, des microphones de salle supplémentaires restent nécessaires.

La différenciation des locuteurs fonctionne en identifiant des signatures vocales distinctes et en les étiquetant de manière cohérente au cours d'une session. Elle n'identifie pas automatiquement les locuteurs par leur nom — la mise à jour V2.0 permet aux utilisateurs de renommer les étiquettes des locuteurs après coup, ce qui est utile sur le plan opérationnel mais nécessite une étape manuelle.

Qualité des appels — Quatre environnements réels

Le déploiement de matériel audio à oreille libre dans des environnements très bruyants dépend du rayon de capture du réseau de microphones et de la capacité d'atténuation ENC. Les environnements dépassant environ 80 dBA introduisent une dégradation qu'aucune architecture actuelle de formation de faisceaux n'élimine totalement. L'ENC à quatre microphones maintient une isolation vocale acceptable dans les bureaux en espace ouvert — conformément aux politiques institutionnelles qui interdisent le matériel de caméra mais autorisent les appareils d'enregistrement uniquement audio.

La qualité des appels a été évaluée dans quatre environnements, en évaluant à la fois l'expérience d'écoute du porteur et la clarté rapportée par la personne à l'autre bout :

Environnement Expérience d'écoute du porteur Clarté rapportée par l'appelant
Intérieur calme Voix clairement intelligible Voix clairement intelligible
Bureau en espace ouvert Voix clairement intelligible Voix clairement intelligible
Rue extérieure Voix clairement intelligible, distincte du bruit ambiant Voix intelligible, mais grondement sourd audible présent ; volume de la voix sensiblement plus faible
Métro (train en mouvement) Voix audible, clarté et volume environ 50 % Voix audible ; bruit du train présent ; certaine réduction de l'intelligibilité

Le résultat du bureau en espace ouvert est la conclusion la plus pertinente sur le plan professionnel. Les performances ENC dans le bruit ambiant du bureau (CVC, clavier, conversation distante) sont suffisamment fortes pour que les deux parties rapportent une communication claire sans ajustement.

La performance dans la rue introduit un compromis. Le porteur entend bien — le système ENC filtre avec succès le bruit environnemental sur le chemin audio entrant. Le chemin sortant est la limite : l'appelant reçoit la voix du porteur plus le bruit environnemental résiduel à un volume réduit. Il s'agit d'une contrainte inhérente à la géométrie de placement à cadre ouvert. Le microphone se trouve à 15–20 cm de la bouche plutôt qu'à 2–3 cm comme dans des écouteurs, captant proportionnellement plus de bruit ambiant par rapport au signal vocal, indépendamment du filtrage algorithmique.

La performance dans le métro est le résultat le plus faible de l'ensemble de données. Le bruit du train en mouvement se situe dans des bandes de fréquences qui chevauchent partiellement les fondamentales vocales, limitant la capacité de l'ENC à soustraire le bruit sans affecter le caractère de la voix. Les utilisateurs qui passent des appels importants dans les transports en commun doivent s'attendre à des résultats dégradés et planifier en conséquence.

Il ne s'agit pas de défaillances spécifiques à cet appareil — elles représentent les limites physiques du placement des microphones à cadre ouvert partagées dans toute la catégorie des lunettes intelligentes axées sur l'audio.

Ce que ces chiffres signifient pour les acheteurs

Les données de test ci-dessus sont les plus utiles lorsqu'elles sont mises en correspondance avec des modèles d'utilisation spécifiques.

Ajustement élevé : Professionnels du droit, participants à des réunions d'entreprise, voyageurs d'affaires multilingues et utilisateurs dans des lieux de travail sensibles à la conformité où les politiques sur les appareils d'enregistrement s'appliquent. Une latence de traduction inférieure à 3,5 secondes est conversationnelle. Une précision de transcription de 96,3 % lors de réunions en direct est suffisante pour la prise de notes professionnelle. Le rayon de capture de 3,3 mètres couvre les configurations de table de conférence standard. Pour les professionnels ayant besoin de lunettes IA sans caméra pour environnements de bureau, il s'agit de la seule catégorie d'appareil qui fonctionne sans restriction dans les institutions interdisant le matériel de caméra.

Ajustement modéré : Utilisateurs qui partagent leur journée entre des environnements professionnels intérieurs et des trajets en transports en commun. La performance est forte dans le premier cas et réduite mais fonctionnelle dans le second. La batterie composite de 8h07 dans une utilisation intensive mixte couvre une journée de travail standard sans recharge en milieu d'après-midi pour la plupart des utilisateurs de cette catégorie.

Ajustement faible : Utilisateurs dont l'environnement d'appel principal est le métro ou le bruit intense de machines extérieures, ou organisateurs de réunions qui accueillent des sessions dans des salles où les intervenants sont régulièrement assis à plus de 3–4 mètres de la position de n'importe quel participant individuel. Ce ne sont pas des scénarios que toute solution audio-first sur un seul appareil gère bien au stade actuel de la catégorie.

Matrice des scénarios d'acheteurs

Cas d'utilisation Conseils sur la batterie Latence de traduction Profil de précision
Bureau quotidien + trajet 8h07 composite suffisant pour la plupart des journées de travail 3,0–3,5s s'adapte au rythme conversationnel 96,3 % en réunions live
Voyage international (multilingue) Prévoir la recharge pour les journées intensives de 8h+ 2,4–3,5s selon la paire de langues 100 % calme / 99,8 % bruit extérieur
Travail de terrain, réunions extérieures 8h07 composite 3,1–3,5s en conditions bruyantes 99,8 % extérieur
Navetteurs dépendants du métro (appels fréquents) Suffisant N/A ENC dégradé dans le bruit du train en mouvement

Pour les utilisateurs qui comparent Dymesty à d'autres appareils portables pour la capture de réunions professionnelles, le guide des appareils de réunion portables évalue la catégorie avant de se concentrer sur des produits individuels. Ce guide couvre le marché plus large des enregistreurs portables — enregistreurs à clip dédiés, pendentifs IA et lunettes intelligentes — avec des critères qui se traduisent directement dans les dimensions de performance testées ici.

La mise à jour logicielle V2.0 a modifié la manière dont ces données sont utilisées après leur capture : l'enregistrement par IA prend désormais en charge l'édition de texte intégral, le renommage des interlocuteurs avec remplacement global en un clic, la recherche par mots-clés dans tous les enregistrements sauvegardés, ainsi qu'une interface de questions-réponses par IA permettant aux utilisateurs d'interroger toute transcription a posteriori. Le module de traduction a ajouté la détection automatique des langues et la recherche dans l'historique des sessions. Pour les utilisateurs ayant déjà adopté cet appareil, comprendre ce que la mise à jour a modifié au niveau du flux de travail est tout aussi important que les chiffres de performance bruts — la présentation détaillée des fonctionnalités de la V2.0 couvre ces changements en profondeur.

Contexte pour situer ces chiffres sur le marché plus large : la précision de la traduction dans la catégorie des appareils audio d'abord varie d'environ 85 % (Solos AirGo 3 dans des conditions bruyantes, selon des rapports indépendants) aux chiffres documentés ici. Les modèles équipés d'un écran ajoutent une couche de correction visuelle qui fait défaut aux appareils uniquement audio, ce qui compense partiellement une précision acoustique moindre en affichant le texte reconnu à l'utilisateur. Le compromis concerne la batterie — le fonctionnement de l'écran MicroLED ajoute environ 200 à 500 mW à la consommation électrique, réduisant l'autonomie à 2–4 heures pour des modèles comme les Even Realities G2. Le test de précision des lunettes intelligentes de traduction par IA couvre les deux catégories dans des conditions de test équivalentes pour une comparaison directe.

Foire aux questions

L'autonomie de 48 heures signifie-t-elle que je peux utiliser la traduction pendant 48 heures d'affilée ?

Non. Le chiffre de 48 heures est une évaluation d'usage mixte typique obtenue selon les tests standard du fabricant, qui accorde une importance considérable à l'audio passif. La traduction par IA en continu est l'un des modes de fonctionnement les plus gourmands en énergie car elle sollicite simultanément le réseau de microphones, le pipeline de reconnaissance vocale (ASR) et la traduction dans le cloud. Le test composite ci-dessus — 1 heure de traduction dans le cadre d'une session mixte de 8h07 — est un guide plus précis pour les utilisateurs dont la journée implique de multiples fonctions IA actives. L'autonomie en mode traduction seule se situerait quelque part entre le chiffre composite et le plafond de 48 heures, selon la proportion de traitement actif par rapport à la lecture audio durant la session.

Qu'advient-il de la précision de la transcription si j'ai un accent ou si je parle un anglais non natif ?

Le test ci-dessus a été réalisé avec un seul locuteur de langue maternelle anglaise. La précision de la reconnaissance vocale sur une parole avec accent varie selon le type d'accent et la couverture des données d'entraînement du modèle sous-jacent. Les modèles entraînés sur de grands corpus multilingues gèrent généralement les principaux accents mondiaux avec des taux d'erreur inférieurs à ceux des modèles monolingues restreints, mais aucun chiffre de précision publié par un fabricant — y compris les données ci-dessus — ne doit être considéré comme s'appliquant uniformément à tous les locuteurs. Les utilisateurs ayant un accent régional prononcé devraient tester l'appareil avec leur propre voix avant de s'engager dans des cas d'utilisation professionnelle où la précision est critique.

Puis-je enregistrer une réunion autour d'une grande table de conférence ?

La distance de captation efficace testée est de 3,3 mètres. Pour les configurations de table de réunion standard de quatre à six personnes, cela est suffisant lorsque le porteur des lunettes est centré ou proche de la plupart des interlocuteurs. Dans les salles plus grandes, ou dans les configurations où certains interlocuteurs sont assis à plus de 3,3 mètres, la précision diminuera avec la distance. L'appareil ne remplace pas une infrastructure de microphones de salle pour les réunions de grande envergure.

La latence de traduction est-elle la même pour les plus de 100 langues prises en charge ?

Non. Les données ci-dessus couvrent quatre paires de langues. L'anglais vers le chinois a été 25 % plus rapide que les paires européennes dans des conditions calmes, et la même différence a été observée dans le bruit extérieur. Les paires de langues moins courantes — en particulier celles dont la couverture des données d'entraînement du modèle est moindre à l'échelle mondiale — produiront dans la plupart des cas une latence plus élevée que les quatre testées ici. La plage de 2,4 à 3,5 secondes doit être comprise comme reflétant des paires de langues très utilisées et bien prises en charge dans de bonnes conditions réseau.

Comment la qualité des appels se compare-t-elle entre les Dymesty Jobs Circle et les Cook Edge ?

Les deux modèles partagent le même réseau de quatre microphones et le même matériel ENC ; par conséquent, les résultats de qualité d'appel de ce rapport s'appliquent aux deux montures. La différence entre les modèles réside dans la géométrie de la monture, l'esthétique des branches et la compatibilité des verres — les spécifications audio et IA sont identiques sur l'ensemble de la gamme.

0 commentaire

Laisser un commentaire

Veuillez noter que les commentaires doivent être approuvés avant leur publication.

LUNETTES DYMESTY AI

LUNETTES DYMESTY AI

$299 399
Coupon 30 $
Offer expires in 09:34
Cliquez pour obtenir