Présentation
Parrot 0.24.2 est une application gratuite et open‑source (GPL‑3.0) destinée à l’enregistrement de réunions sur macOS 14 ou version ultérieure, exclusivement sur les machines Apple Silicon. L’outil détecte le lancement d’une application de visioconférence, propose d’enregistrer l’audio déjà diffusé par le Mac et active un copilote IA capable de répondre à la volée en s’appuyant sur des documents locaux.
Architecture et fonctionnement
Le flux audio reste entièrement sur l’appareil ; aucune piste n’est transmise à un serveur externe, sauf si l’utilisateur active la transcription cloud. La transcription et la détection des intervenants s’exécutent localement grâce à Whisper intégré et à un modèle de reconnaissance de locuteurs développé par Apple. Le texte transcrit est ensuite indexé et découpé en fragments (chunking) avant d’être embarqué dans un espace vectoriel à l’aide des modèles de langage d’Apple, ce qui permet des recherches sémantiques sans sortie du dispositif.
Le copilote peut être alimenté par différents moteurs : Claude (cloud), OpenAI, Gemini, Groq ou un serveur local Ollama. Chaque moteur reçoit uniquement le texte de la transcription ; l’audio n’est jamais envoyé. Les clés d’API sont stockées dans le trousseau macOS, limitant les risques de fuite. Le coût d’une session est affiché en temps réel (exemple : $0,07 pour une heure de réunion incluant transcription, cartes du copilote et rapport post‑appel).
Parrot supporte la détection automatique de la langue et propose un basculement d’un clic vers un modèle multilingue (Large V3 Turbo ou Groq) dès les premières secondes d’une conversation non anglophone. Les réponses du copilote sont ancrées dans les documents fournis par l’utilisateur (PDF, texte, markdown) et chaque extrait cité indique sa source.
Analyse des impacts et limites
Le principal avantage technique réside dans le traitement entièrement local : confidentialité renforcée, absence de télémétrie et conformité aux exigences de protection des données. Le modèle d’embedding sur‑device évite les coûts de bande passante et les latences liées aux appels cloud, ce qui est pertinent pour les environnements à bande limitée.
En revanche, la dépendance à la puissance de calcul du Mac (Apple Silicon) impose une contrainte matérielle : les performances de transcription et de recherche vectorielle peuvent diminuer sur des machines moins récentes. De plus, la précision de la détection de locuteurs et de la traduction multilingue reste fonction du modèle sous‑jacent, et aucune métrique de taux d’erreur n’est fournie dans la documentation officielle.
Le système de profils (sept modèles pré‑définis ou création personnalisée) ajoute de la flexibilité, mais chaque profil nécessite une configuration manuelle des cartes et des règles, ce qui peut alourdir le déploiement dans des équipes nombreuses. Enfin, le recours à des services externes (Claude, OpenAI, etc.) implique des coûts variables selon le volume de tokens, même si le texte reste le seul élément transmis.