✨ EN VIVO ☁️ 24°C Quito, EC
⛽ PRECIOS Extra/Eco: $3.242 Súper: $4.74 Diésel: $3.181
🚗 MOVILIDAD Pico y Placa hoy en Quito restringe a: -
✨ EN VIVO ☁️ 24°C Quito, EC
⛽ PRECIOS Extra/Eco: $3.242 Súper: $4.74 Diésel: $3.181
🚗 MOVILIDAD Pico y Placa hoy en Quito restringe a: -

NVIDIA lanza Nemotron 3 Diarization: modelo de 100M para rastreo de voces

Esquema de funcionamiento de NVIDIA Nemotron 3 Diarization

Actualizada:

4 min de lectura
  • El modelo cuenta con 100 millones de parámetros y licencia comercial abierta OpenMDW 1.1.
  • Rastrea hasta 8 hablantes simultáneos, duplicando la capacidad de versiones anteriores.
  • Funciona tanto en procesamiento de audios grabados como en transmisión en tiempo real.
  • Opera a través del ecosistema NVIDIA NeMo en arquitecturas Ampere, Ada, Hopper y Blackwell.

El gigante del hardware y la computación acelerada NVIDIA liberó oficialmente Nemotron 3 Diarization, un modelo de diarización de audio de 100 millones de parámetros (100M) bajo pesos abiertos en Hugging Face. El sistema responde con precisión milimétrica a la interrogante crítica de cualquier conversación: quién habló y en qué momento exacto, facilitando la separación de turnos de diálogo incluso en entornos acústicamente complejos con solapamiento de voces.

¿Quieres recibir noticias de última hora en tu celular? Sigue nuestro canal de WhatsApp y agréganos en Google para no perderte las primicias.

En las canalizaciones convencionales de procesamiento del habla, los sistemas de reconocimiento automático (ASR) convierten las ondas sonoras en cadenas de texto, pero carecen de la capacidad de distinguir la identidad de los interlocutores. Sin un módulo de diarización preciso, los resúmenes automatizados no pueden discernir qué participante asumió un compromiso o formuló una objeción, limitando la utilidad de asistentes en reuniones corporativas, centros de llamadas y transcripciones judiciales.

Publicidad

Arquitectura neuronal y procesamiento de señales

La nueva arquitectura duplica el umbral de su predecesor, el modelo Streaming Sortformer 4spk, elevando el límite operativo a 8 interlocutores simultáneos. El desarrollo fue optimizado específicamente para escenarios de interacción espontánea donde las personas se interrumpen, elevan la voz o intervienen a la par sin turnos rígidos.

Técnicamente, el modelo admite señales monocanal muestreadas a 16 kHz en formatos convencionales como WAV, FLAC, Opus o MP3. La señal de audio es descompuesta en espectrogramas de Mel con un intervalo de 10 milisegundos, que posteriormente se agrupan en factores de 8 para alimentar marcos de codificación de 80 milisegundos. Un codificador basado en Transformer de 31 capas procesa las dependencias temporales y proyecta las probabilidades de actividad vocal en una cuadrícula temporal unificada.

Despliegue operativo y licencias comerciales

Los pesos de la red han sido distribuidos bajo la licencia OpenMDW 1.1, la cual autoriza el aprovechamiento comercial y la integración en productos privados sin cobro de regalías. El sistema se ejecuta sobre entornos Linux mediante el marco de desarrollo de NVIDIA Corporation y se descarga directamente desde Hugging Face, requiriendo tarjetas gráficas de las familias Ampere, Ada Lovelace, Hopper o Blackwell.

Este avance converge con la modernización de los sistemas de procesamiento de señales y telecomunicaciones, permitiendo que empresas de software incorporen transcripciones de reuniones, analítica de grabaciones y memoria conversacional para agentes autónomos. En consonancia con los estándares de la comunidad de ingeniería eléctrica y electrónica documentados por el IEEE, la eficiencia computacional de Nemotron 3 Diarization garantiza una inferencia de bajísima latencia en servidores dedicados.

Aplicaciones industriales en analítica de audio y transcripción

La relevancia práctica de Nemotron 3 Diarization abarca múltiples industrias productivas. En el sector judicial y corporativo, la generación automática de actas fidedignas reduce drásticamente las horas de transcripción manual, garantizando la trazabilidad exacta de acuerdos y testimonios. Asimismo, en el ámbito de la telemedicina y la atención clínica, los médicos pueden registrar consultas multidisciplinarias donde participan varios profesionales y familiares, separando con nitidez las instrucciones clínicas de los comentarios del paciente.

La capacidad de procesamiento en tiempo real con latencias inferiores a 200 milisegundos convierte al modelo en una pieza indispensable para la siguiente generación de interfaces conversacionales y robots de servicio. Al liberar los pesos de manera abierta, NVIDIA promueve un ecosistema de innovación descentralizado que potencia la competitividad tecnológica global.

Adicionalmente, la compatibilidad nativa con canalizaciones de NeMo Guardrails y Riva simplifica el despliegue en infraestructuras locales con estrictas normativas de privacidad de datos. Ingenieros de sistemas pueden estructurar flujos de auditoría continua en salas de operaciones financieras sin enviar grabaciones confidenciales a servidores externos en la nube, resguardando la información estratégica corporativa.

ÚLTIMAS NOTICIAS

Compartir
¡Enlace copiado al portapapeles!
Scroll to Top
Visita nuestra Red de Medios Aliados: Ecuador Noticias 360  |  Mundo Tuerca