Parle à chacune, puis dis-moi laquelle sonne le mieux. Au casque ou aux écouteurs, c'est plus parlant.
Version 1 · celle en ligne aujourd'hui
Cascade classique
Trois étages séparés : il écoute, il réfléchit, il parle. Tu vois le texte avant qu'il le dise, donc tu gardes la main sur chaque phrase. Environ 1,5 seconde de silence avant qu'il réponde.
Parler à la version 1 →
Version 2 · temps réel, cerveau Gemini
Speech-to-speech natif
Un seul modèle entend et répond en audio, sans passer par le texte. Environ 0,4 seconde. Il peut te couper, hésiter, faire des « hum ». Le prix : on ne peut plus relire sa phrase avant qu'il la dise.
Parler à la version 2 →
Les trois partagent le même prompt de vente (8 000 caractères), la même voix et les mêmes outils. La seule différence est le moteur. Écoute surtout : le naturel, les silences, et s'il tient bien la conversation commerciale.