Jarvis répond à la voix, en français, en moins d'une seconde. Il lit l'agenda, les mails et les tâches, se souvient de tout dans une mémoire en Markdown, et prend des initiatives sans jamais devenir agaçant.
Un assistant vocal doit répondre tout de suite. Un assistant utile doit aller vérifier. Les deux ne tiennent pas dans le même modèle, alors Jarvis en a deux, et un routeur à règles qui ne demande jamais à une IA de décider.
Rapide et peu coûteux, il tient environ 90 % de la conversation. Quand une question demande un fait, il ne devine pas : il dit une phrase courte et passe le relais.
Session chaude permanente. Il lit le vault, recoupe, écrit une note, lance une tâche de fond, envoie un mail après accord. Pendant ce temps la conversation continue.
Le speech-to-speech a été rejeté : il perd le texte, donc la mémoire, les outils et les logs. Jarvis garde une cascade écoute → texte → cerveau → voix, et grappille les millisecondes à chaque étape.
Le micro reste ouvert, la fin de phrase est détectée au silence. Une touche maintenue passe en push-to-talk franc et gagne 330 ms. Les deux modes ne se mélangent jamais.
Premier son environ 266 ms après la première phrase. Trois voix au sélecteur, une voix de secours qui reprend les paquets si Google tombe en plein tour.
Huit phrases d'attente synthétisées à l'avance, la moitié avec le prénom. Si le cerveau dépasse le délai, Jarvis en glisse une en 0 ms et la vraie réponse s'enchaîne derrière.
AudioWorklet dans le navigateur, WebSocket vers le serveur, connexions sortantes gardées chaudes. La poignée de main TLS coûtait plus cher que la synthèse.
Toute la mémoire de Jarvis est un vault Obsidian : profil, projets, décisions, journal. Lisible par un humain, versionné, et c'est lui qui fait foi. Tout le reste est calculé et jetable.
Les liens entre notes deviennent une constellation. Un clic ouvre la note en onglet, éditable, Ctrl+S pour enregistrer.
Chaque fil est gardé et rouvrable dans l'état exact. Jarvis cite de mémoire le premier message d'un fil rouvert.
Au réveil du serveur, il écrit le journal du dernier jour actif et propose les leçons à trier.
Chaque note écrite par une IA est commitée. On sait toujours qui a changé quoi, et on revient en arrière en une commande.
Les API officielles en direct, aucun hub tiers : gratuit pour toujours, un seul saut réseau, et les jetons restent sur la machine.
« C'est quoi mon programme ? » lit un cache local, quasi instantané. Rappels à quatre moments avant un rendez-vous, dits à la voix.
Chaque boîte a un nom court qu'on dit à voix haute. Lecture à la demande, brouillons préparés, la veille signale le nouveau toutes les deux minutes.
Les tâches du jour synchronisées. Une demande de développement part dans une session séparée, et une notification coupe la ligne quand c'est fini.
Fiches cinéma, musique, livres, et un parcours de code écrit à la main : 81 leçons, 189 exercices. Un juge relit la réponse, une coquille ne compte plus faux.
Toutes les 20 minutes il regarde l'état réel et choisit la seule chose qui vaut d'être dite, ou rien. Jamais deux fois la même phrase, 45 minutes minimum entre deux propositions.
Lire est libre. Écrire hors du vault, lancer une commande, envoyer un mail : Jarvis demande. Les fichiers d'identifiants ne sont jamais accessibles, même sur un oui.
Chaque fournisseur a été mesuré avant d'être retenu, et chaque marche arrière est documentée. Rien n'attache Jarvis à une machine ni à un abonnement.
Projet privé, sans démo publique. Les mêmes briques se déploient chez un client : agent vocal, mémoire d'entreprise, intégrations métier.