5 innovaciones con IA de SoftServe. 1- Reconocimiento de voz para detectar dislexia infantil

 

Por: Volodymyr Karpiv, Director de I+D en SoftServe.

Más allá de la inteligencia artificial generativa (IA Gen) para la generación de texto, existen otras direcciones tecnológicas que están ganando terreno y que podrían transformar diversas industrias, como los algoritmos de aprendizaje automático (machine learning o ML, por sus siglas en inglés), la computación cuántica, la robótica, la realidad extendida o la biotecnología.  

En su reciente informe «Hype Cycle 2024«, los analistas de Gartner señalan que las empresas deben examinar no sólo la IA Gen, sino también otras tecnologías emergentes con potencial transformador.

Los inversores también están explorando tendencias alternativas: McKinsey, en su más reciente informe (publicado el 23 de octubre de 2024), identifica 18 industrias que podrían remodelar la economía global y generar entre 29 y 48 billones de dólares en ingresos para 2040.

 

Equipo I+D.

SoftServe no siempre se relaciona con el hardware y la investigación científica. Los expertos de la compañía no sólo son ingenieros de software y gerentes de proyectos, sino que también hay otros equipos técnicos que trabajan en diferentes corrientes innovadoras.

Uno de ellos, el de Investigación y Desarrollo (I+D) de SoftServe, se estableció en 2008 y desde entonces ha crecido de 4 personas a más de 100 investigadores, ingenieros, desarrolladores y gerentes de producto interdisciplinarios en 8 países (Ucrania, Polonia, Reino Unido, Bulgaria, Singapur, Colombia, Alemania y Canadá).

Utilizando las últimas tecnologías y ciencia aplicada en su trabajo, el equipo supera barreras existentes para descubrir soluciones innovadoras y con beneficios inmediatos, ahorrando tiempo y dinero aparte de crear nuevas oportunidades.

Estos son los últimos proyectos en los que el equipo de I+D de SoftServe está enfoncándose actualmente:

Reconocimiento de voz para detectar dislexia infantil.

¿Si usted alguna vez ha visto a niños usando control por voz sin éxito?, hay una razón detrás de eso.

El reconocimiento de voz se centra en convertir el lenguaje hablado en texto o comandos escritos. Involucra el uso de algoritmos y modelos de aprendizaje automático para analizar e interpretar señales de audio, reconociendo y transcribiendo palabras en texto.

Los productos y servicios que utilizan esta tecnología son los asistentes de voz, el software de transcripción/dictado, las funciones de control manos libres de los dispositivos y las herramientas de traducción de idiomas.  

La tecnología detrás de estos servicios es el reconocimiento automático del habla (ASR, por sus siglas en inglés), que usa modelos acústicos y de lenguaje, así como redes neuronales, para convertir el lenguaje hablado en texto escrito.

Según diversos informes como uno de Statista, el tamaño del mercado de ASR se estima en alrededor de 8 mil millones de dólares este año y se prevé que crezca un 15-25% anual.

Sin embargo, los sistemas actuales de reconocimiento automático de voz basados en datos de voces de adultos, a menudo malinterpretan el habla infantil con una tasa de error del 20% al 50%.

Esto afecta a soluciones educativas y de entretenimiento, donde un reconocimiento de voz preciso puede mejorar las experiencias de aprendizaje y juego de los niños.

El equipo de I+D de SoftServe está trabajando en un modelo ASR específicamente para niños, ¡y tiene una precisión aproximadamente 8 veces mayor que las mejores soluciones de vanguardia disponibles hoy en día!

En esto, fuimos aún más allá para ampliar las posibilidades de aprendizaje para los niños, utilizando los avances de la IA generativa de audio: el nuevo modelo puede hacer una transcripción fonética, asegurando que los patrones únicos de habla de los niños se capten con precisión.

Con una precisión mucho mayor y un costo equilibrado, la solución podría usarse para la detección de dislexia.

Actualmente, el equipo está trabajando en soporte multilingüe, optimización del modelo y mejora de la precisión; y la última versión, basada en NVIDIA NIM, muestra un rendimiento aún mejor.

Compartir:
Los más leídos

Logo del podcast Entrevistas Exclusivas




RT

Información especializada de Tecnología, Innovación, Ciencia e Investigación global.