Axoly Tech

De l'audio au texte : IA, confidentialité et traitement asynchrone.

À l'ère du numérique, la confidentialité de nos données est devenue un enjeu essentiel. C'est pour cela que nous développons des services numériques éthiques et durables, faits pour protéger vos données et pour durer dans le temps.

Le projet

Dernièrement, nous avons relevé un défi passionnant : concevoir une solution avec IA qui préserve la souveraineté technologique et la vie privée des utilisateur⸱ice⸱s.

Plutôt que de transférer des fichiers audios sensibles vers des serveurs externes, nous proposons une architecture décentralisée permettant à chaque organisation de déployer l'outil directement sur son infrastructure existante. Il s'agit d'un service de transcription alternatif aux logiciels traditionnels.

Illustration du service « From speech to text » : un formulaire pour choisir un fichier audio et saisir son adresse e-mail, entouré de personnes qui enregistrent un podcast et d'une personne qui relit sa transcription.

Objectifs stratégiques

1

Garantir une confidentialité maximale des données : que ce soit pour des données sensibles, un besoin de confidentialité ou simplement parce qu’on n’a pas envie que nos enregistrements se retrouvent sur des plateformes tierces. Cela implique une autonomie accrue.

2

Promouvoir une démarche en éco-conception : la réutilisation du matériel informatique existant évite la surconsommation de ressources et l’obsolescence programmée.

Les principes de notre solution

Accessible à tous⸱tes

Chaque membre de l'organisation a la possibilité de transformer facilement un fichier audio en texte écrit.

Ouvert à plusieurs personnes à la fois

Le logiciel doit permettre d'utiliser simultanément le service, sans limitation ni contrainte.

Sans urgence de traitement

Il n'est pas absolument nécessaire d'obtenir une transcription instantanée. Les utilisateur⸱ice⸱s peuvent soumettre leurs fichiers et récupérer les transcriptions plus tard.

Intégré sans surcoût

La solution doit s'intégrer parfaitement à l'infrastructure existante, sans générer de coûts supplémentaires après son développement initial.

Le logiciel

  1. Chaque employé⸱e se connecte au site web de l'application et télécharge son fichier audio, ainsi que son adresse e-mail pour recevoir la transcription.

  2. Le fichier est sauvegardé sur le serveur.

  3. Pendant la nuit, lorsque le serveur de l'entreprise est moins sollicité, un processus de batch se déclenche. Une transcription est générée pour chaque fichier téléchargé durant la journée, en utilisant un module d'IA spécifique.

  4. Une fois la transcription terminée, le serveur envoie un e-mail contenant la transcription à la personne concernée.

Schéma du fonctionnement du logiciel : le fichier audio est envoyé au serveur, transcrit de façon asynchrone pendant la nuit, puis la transcription terminée est envoyée par e-mail à la personne concernée.
Diagramme des composants de l'application : l'application web dépose les fichiers audio traités par le backend, un processus de batch les récupère depuis la base de données, les transcrit via le modèle d'IA audioToText, puis le composant d'envoi de courriels transmet la transcription à la personne concernée.
Diagramme des composants de l'application

Méthodologie

Pour le développement de cette application, nous avons utilisé une méthodologie agile et intégré le cadre théorique du GREENSOFT model. Un Sustainability Journal a été créé, dans lequel nous avons consigné chaque décision et ses conséquences en termes de durabilité.

Cette approche permet :

  • d'intégrer les préoccupations et exigences en matière de durabilité au processus de développement ;
  • de conserver un registre des changements et des implémentations réalisés, ainsi que leurs impacts en termes d'éco-conception.

L'éco-conception

On ne peut pas ignorer les impacts environnementaux des modèles d'IA : leur entraînement comme leur exécution consomment beaucoup d'énergie et de ressources matérielles. C'est pourquoi nous avons placé la sobriété numérique au cœur de notre démarche. Chaque décision technique, du choix des serveurs à celui du modèle, est évaluée afin de concevoir une solution réellement utile tout en limitant son empreinte.

Comment atteindre nos objectifs de durabilité ?

  1. Prioriser l'efficacité plutôt que l'immédiateté des réponses

    • L'utilisation ou la réutilisation de serveurs moins puissants : la transcription prend plus de temps, mais il ne faut pas créer de nouveaux serveurs ni engager de frais supplémentaires.
    • Une limitation de l'impact sur la consommation de ressources matérielles. La plupart des logiciels fonctionnent durant les pics de demande d'énergie. Nous avons décidé de l'exécuter la nuit, ce qui permet d'optimiser l'usage du serveur.
    • Un découplage entre l'envoi des fichiers au serveur et leur traitement.
  2. La détermination du modèle d'IA

    • Autonomie et indépendance : modèles d'IA ouverts qui peuvent être remplacés.
    • Modèles pré-entraînés, spécialisés dans certaines langues : cela nous permet d'obtenir une meilleure transcription, même avec des modèles de taille réduite.
    • Suite à des tests, nous avons déterminé le modèle le plus léger capable de produire des transcriptions acceptables.

Que reste-t-il à faire ?

Niveau fonctionnalités

  • Étendre les modèles d'IA potentiels : traduction de texte ou résumé de documents volumineux.
  • Module indépendant adaptable à tout type de tâche nécessitant un traitement asynchrone.

Niveau éco-conception

  • Quantifier les impacts : mesurer les émissions de carbone générées par minute d'audio transcrite.
  • Répondre aux critères essentiels du GR491. S´agissant d’un projet pilote, seuls quelques critères ont été considérés durant la phase de développement. Une analyse plus approfondie serait nécessaire si l’application venait à évoluer.

La protection de vos données et souveraineté

Grâce au développement de ce logiciel, nous avons démontré qu'il est possible de déployer des services utilisant des modèles d'IA sur des serveurs standards, sans recourir à des services externes, préservant ainsi la confidentialité et la souveraineté des données. Et ce, sans engendrer de coûts supplémentaires une fois le système implémenté.

Qui plus est, en questionnant l'usage réel des outils technologiques, nous pouvons observer des impacts directs liés à leur implémentation. Dans notre cas, en choisissant de traiter nos transcriptions de manière asynchrone et différée, nous réutilisons des serveurs existants qui n'auraient pas suffi si une réponse immédiate avait été requise.

Cette approche illustre comment une réflexion approfondie sur les modalités de déploiement peut conduire à des solutions plus efficaces, économes et respectueuses des ressources existantes.

Votre projet a une histoire. Construisons la suite ensemble.

Un premier échange de 30 minutes, sans engagement, pour voir si nous pouvons vous aider.