Con el conjunto de datos fon茅ticos recopilado en campo, la siguiente etapa del desarrollo se centr贸 en la transformaci贸n y procesamiento de las se帽ales de audio en la infraestructura de nube de Google Cloud. Para lograr que un modelo de Inteligencia Artificial interpretara las emisiones vocales de los ni帽os, las grabaciones an谩logas fueron procesadas digitalmente y convertidas en espectrogramas. Estos espectrogramas representan visualmente la distribuci贸n de la frecuencia y la energ铆a de la voz a lo largo del tiempo, convirtiendo un flujo de sonido continuo en una matriz de datos apta para el aprendizaje autom谩tico.
La plataforma Google Cloud Vertex AI se utiliz贸 como el entorno principal para la gesti贸n, entrenamiento y validaci贸n de los modelos. Dentro de esta herramienta, los espectrogramas fueron etiquetados y categorizados seg煤n los fonemas y niveles de modulaci贸n requeridos por el juego. Vertex AI facilit贸 la ejecuci贸n de experimentos de entrenamiento automatizado (AutoML) y la configuraci贸n de redes neuronales optimizadas para clasificaci贸n espectral, permitiendo evaluar la precisi贸n de la inferencia ante diferentes variantes de tono e intensidad vocal.
Durante el proceso de entrenamiento en la nube, se ajustaron las m茅tricas de rendimiento para minimizar los falsos negativos en la detecci贸n de los sonidos. La infraestructura escalable de Vertex AI permiti贸 iterar r谩pidamente sobre los datos, analizando c贸mo respond铆a el modelo ante patrones complejos de frecuencia y calibrando la matriz de pesos de la red. Este an谩lisis profundo en la nube fue clave para filtrar ruido innecesario y conservar 煤nicamente las firmas ac煤sticas esenciales para el reconocimiento del habla.
El resultado final de esta fase fue la exportaci贸n de un modelo altamente optimizado en formato TensorFlow Lite. Este archivo comprimido encapsula el conocimiento generado durante el entrenamiento en Vertex AI, quedando listo para ser integrado de manera local dentro del motor de la aplicaci贸n m贸vil. Esta transici贸n de la nube al dispositivo garantiza que la inferencia de la voz se ejecute de forma 谩gil, privada y sin depender de una conexi贸n continua a internet durante la experiencia de juego.
