Honor ha anunciado el debut del primero en los últimos días Modelo de voz grande en la salda en Honor Magic V5. El resultado es presentado por la empresa china como Solución a los principales desafíos técnicos en el campo de reconocimiento y traducción vocal multilingüe en dispositivosincluido el progreso principal en el reconocimiento de voz en la transmisión de baja latencia y la distribución eficiente de modelos a gran escala.
El dilema de la privacidad y el rendimiento
Las soluciones de traducción convencionales actuales dependen en gran medida de la infraestructura de la nube, planteando problemas de privacidad significativos, especialmente para conversaciones confidenciales como las llamadas. Aunque algunas soluciones existentes en el mercado intentan resolver este problema, a menudo comprometen el rendimiento, incluido el velocidad, precisión y ocupación de la memoriadebido a las limitaciones de los dispositivos móviles.
Según Honor, su nueva tecnología excede estas limitaciones, ofreciendo una experiencia comparable a la de la nube directamente en el dispositivo, prometiendo una sólida privacidad y un mayor rendimiento.
Dos investigaciones relacionadas fueron recompensadas durante el interponido 2025, la Conferencia Mundial sobre Ciencia y Tecnología del Procesamiento del Lenguaje del Discurso.
Honor agrega los descansos para transcribir mejor el discurso
El primer artículo de investigación, «MFLA: Monotonic terminado por el reconocimiento de voz», se ocupa del desafío de obtener un reconocimiento de voz en la transmisión de baja latencia y la alta precisión en los dispositivos. ‘Linding de un sensor basado en CIF (Continuo integrado y fuego) con la estrategia Wait-K es un punto fuerte. Si bien las estrategias tradicionales de Wait-K funcionan bien para actividades más simples como la traducción automática, su aplicación directa al reconocimiento vocal automático (ASR) está limitada por la naturaleza continua del habla, con altos costos computacionales altos.
Honor introdujo un predictor basado en el mecanismo CIF. Este predictor asigna explícitamente las características acústicas continuas a las decisiones bordes discretas requeridas por la estrategia de espera de K, adaptando este enfoque de baja latencia del dominio del texto al del habla.
En pocas palabras:
-
El problema básico es comprender y transcribir Mientras una persona hablasin esperar a que termine la oración, pero también sin cometer errores.
-
«Wait-K»: es una regla simple («espera un poco y luego comience a escribir»), que funciona bien en los textos, pero con audio es más difícil porque El discurso es continuono tiene espacios claros entre las palabras.
-
CIF Es como un «contrarrestado» que mira el sonido y decide donde probablemente termina una palabra.
-
La idea de Honor es usar el CIF para transformar el flujo de audio continuo en Puntos de Taglio discretos (casi como agregar espacios) para que la estrategia Wait-K también pueda funcionar con la voz. Así llegamos al Transcripción casi en tiempo real en el dispositivo, con menos cálculos desperdiciados.
Honor traduce los textos con una doble escala para ser más eficiente
El segundo artículo «,Nuevo modelado parásito de doble escala para traducción de voz multilingüe eficiente y precisa«, Excede los límites de la inferencia en tiempo real para grandes discursos en dispositivos con recursos limitados. Esta característica introduce una estrategia de acelerar el muestreo especulativo de doble escala, desarrollado en colaboración con la Universidad Shanghai Jiao Tong, que puede implementarse directamente en los dispositivos y promete la posibilidad de obtener un aumento del 38% en la velocidad de la influencia sin comprometer el desempeño del modelo.
En pocas palabras:
-
El problema aquí radica en la traducción discursos largos En varios idiomas inmediatamente y sobre dispositivos con capacidad de procesamiento reducida (teléfono inteligente, auriculares, etc.).
-
La solución radica en usar una composición de «Muestreo especulativo de doble escala».
-
Comienza desde un Modelo pequeño y rápido Ese «arroja un borrador» de la traducción.
-
A modelo más grande Verifique y corrija dónde necesite.
-
«Doble escala» es un sistema que analiza es bloques reducidos (detalle) ambos bloques más largos (contexto) para proceder más enviado.
-
-
Como efecto práctico se obtiene Hasta aproximadamente un 38% más de velocidad en la salida de la traducción, sin perder calidady se puede hacer directamente en el dispositivo).
Reducción del consumo de memoria en la comunicación en el dispositivo
Honor informes de eficiencia de memoria, reduciendo el tamaño de 3-4 GB a solo 800 MB, con un ahorro del 75% de la memoria. Esto incluye la integración de seis paquetes lingüísticos (chino, inglés, alemán, francés, español e italiano), eliminando la necesidad de seis descargas separadas por 500 MB y ahorrando aproximadamente 2.78 GB de memoria.
La tecnología permite la traducción en tiempo real «hable por ti», progreso significativo en comparación con los métodos tradicionales que requieren esperar la finalización de una oración completa, con un aumento, como hemos dicho, del 38% de la velocidad de procesamiento y el 16% de la precisión de la traducción.
