Axoly Tech

Del audio al texto: IA, privacidad y procesamiento asíncrono.

En la era digital, la privacidad de nuestros datos se ha convertido en un tema esencial. Por eso desarrollamos servicios digitales éticos y sostenibles, diseñados para proteger tus datos y perdurar en el tiempo.

El proyecto

Recientemente, asumimos un desafío apasionante: diseñar una solución con IA que preserve la soberanía tecnológica y la privacidad de las personas usuarias.

En lugar de transferir archivos de audio sensibles a servidores externos, proponemos una arquitectura descentralizada que permite a cada organización desplegar la herramienta directamente en su infraestructura existente. Se trata de un servicio de transcripción alternativo a los programas tradicionales.

Ilustración del servicio «From speech to text»: un formulario para elegir un archivo de audio e introducir una dirección de correo electrónico, rodeado de personas grabando un podcast y una persona revisando su transcripción.

Objetivos estratégicos

1

Garantizar la máxima privacidad de los datos: ya sea por tratarse de datos sensibles, por necesidad de confidencialidad o simplemente porque no queremos que nuestras grabaciones acaben en plataformas de terceros. Esto implica una mayor autonomía.

2

Promover un enfoque de ecodiseño: la reutilización del hardware existente evita el consumo excesivo de recursos y la obsolescencia programada.

Los principios de nuestra solución

Accesible para todas las personas

Cada miembro de la organización puede convertir fácilmente un archivo de audio en texto escrito.

Abierto a varias personas a la vez

El software debe permitir usar el servicio de forma simultánea, sin limitaciones ni restricciones.

Sin urgencia de procesamiento

No es absolutamente necesario obtener una transcripción instantánea. Las personas usuarias pueden enviar sus archivos y recuperar las transcripciones más tarde.

Integrado sin costo adicional

La solución debe integrarse perfectamente en la infraestructura existente, sin generar costos adicionales tras su desarrollo inicial.

El software

  1. Cada persona empleada se conecta al sitio web de la aplicación y sube su archivo de audio, junto con su dirección de correo electrónico para recibir la transcripción.

  2. El archivo se guarda en el servidor.

  3. Durante la noche, cuando el servidor de la empresa tiene menos carga, se activa un proceso por lotes. Se genera una transcripción para cada archivo subido durante el día, utilizando un módulo de IA específico.

  4. Una vez finalizada la transcripción, el servidor envía un correo electrónico con la transcripción a la persona correspondiente.

Esquema del funcionamiento del software: el archivo de audio se envía al servidor, se transcribe de forma asíncrona durante la noche y, después, la transcripción finalizada se envía por correo electrónico a la persona correspondiente.
Diagrama de los componentes de la aplicación: la aplicación web sube los archivos de audio procesados por el backend, un proceso por lotes los recupera desde la base de datos, los transcribe mediante el modelo de IA audioToText y, después, el componente de envío de correos entrega la transcripción a la persona correspondiente.
Diagrama de los componentes de la aplicación

Metodología

Para el desarrollo de esta aplicación, utilizamos una metodología ágil e incorporamos el marco teórico del modelo GREENSOFT. Se creó un Sustainability Journal, en el que registramos cada decisión y sus consecuencias en términos de sostenibilidad.

Este enfoque permite:

  • integrar las preocupaciones y exigencias de sostenibilidad en el proceso de desarrollo;
  • mantener un registro de los cambios e implementaciones realizados, así como su impacto en términos de ecodiseño.

El ecodiseño

No podemos ignorar el impacto ambiental de los modelos de IA: tanto su entrenamiento como su ejecución consumen mucha energía y recursos materiales. Por eso hemos situado la sobriedad digital en el centro de nuestro enfoque. Cada decisión técnica, desde la elección de los servidores hasta la del modelo, se evalúa para diseñar una solución realmente útil y a la vez limitar su huella.

¿Cómo alcanzar nuestros objetivos de sostenibilidad?

  1. Priorizar la eficiencia sobre la inmediatez de las respuestas

    • El uso o la reutilización de servidores menos potentes: la transcripción tarda más, pero no es necesario crear nuevos servidores ni incurrir en costos adicionales.
    • Una limitación del impacto en el consumo de recursos materiales. La mayoría de los programas funcionan durante los picos de demanda energética. Decidimos ejecutarlo por la noche, lo que permite optimizar el uso del servidor.
    • Una desvinculación entre el envío de los archivos al servidor y su procesamiento.
  2. La determinación del modelo de IA

    • Autonomía e independencia: modelos de IA abiertos que se pueden reemplazar.
    • Modelos preentrenados especializados en determinados idiomas: esto nos permite obtener una mejor transcripción, incluso con modelos de menor tamaño.
    • Tras realizar pruebas, determinamos el modelo más ligero capaz de producir transcripciones aceptables.

¿Qué queda por hacer?

A nivel de funcionalidades

  • Ampliar los modelos de IA potenciales: traducción de texto o resumen de documentos extensos.
  • Un módulo independiente adaptable a cualquier tipo de tarea que requiera procesamiento asíncrono.

A nivel de ecodiseño

  • Cuantificar los impactos: medir las emisiones de carbono generadas por minuto de audio transcrito.
  • Cumplir los criterios esenciales de GR491. Al tratarse de un proyecto piloto, durante la fase de desarrollo solo se consideraron algunos criterios. Sería necesario un análisis más exhaustivo si la aplicación llegara a evolucionar.

La protección de tus datos y la soberanía

Gracias al desarrollo de este software, demostramos que es posible desplegar servicios que utilizan modelos de IA en servidores estándar, sin recurrir a servicios externos, preservando así la privacidad y la soberanía de los datos. Y todo ello sin generar costos adicionales una vez implementado el sistema.

Además, al cuestionar el uso real de las herramientas tecnológicas, podemos observar impactos directos vinculados a su implementación. En nuestro caso, al optar por procesar nuestras transcripciones de forma asíncrona y diferida, reutilizamos servidores existentes que no habrían sido suficientes si se hubiera requerido una respuesta inmediata.

Este enfoque ilustra cómo una reflexión profunda sobre las modalidades de despliegue puede conducir a soluciones más eficientes, económicas y respetuosas con los recursos existentes.

Tu proyecto tiene una historia. Construyamos juntos lo que viene.

Una primera conversación de 30 minutos, sin compromiso, para ver si podemos ayudarte.