Cómo configurar inferencia rápida para modelos de voz y multimodales con SGLang-Omni
SGLang-Omni es un runtime especializado para inferencia de modelos de voz y multimodales, gestionando el pipeline desde codificación de audio hasta síntesis.
Idioma
InicioLenguajes
Secciones
SGLang-Omni es un runtime especializado para inferencia de modelos de voz y multimodales, gestionando el pipeline desde codificación de audio hasta síntesis.
GigaAM es una familia de modelos acústicos de código abierto de SberDevices que supera a Whisper en el reconocimiento de habla rusa. Esto es lo que puede hacer y cómo usarlo.
¿Cansado de ahogarte en cursos de redes neuronales? Deep Learning Drizzle es una colección curada de cursos universitarios y conferencias de los mejores laboratorios de IA del mundo: tu antídoto contra los tutoriales fragmentados de YouTube.
MLX-Audio ofrece capacidades ultrarrápidas de TTS, STT y STS para Macs con Apple Silicon. Construido sobre el framework MLX de Apple, ofrece Whisper, Kokoro, clonación de voz y más, todo ejecutándose localmente sin costos en la nube.