GPU Speech Inference on AWS
Dos formas de servir un modelo open source de reconocimiento de voz en GPUs de AWS, comparadas en costo y confiabilidad.
Arquitectura
Un servicio de transcripción en FastAPI sobre ECS con tipo de lanzamiento EC2 con GPU detrás de un Application Load Balancer, y un contenedor de vLLM en una instancia con varias GPUs y paralelismo de tensores. Ambos definidos en CDK con ECR, SSM y AMIs de Deep Learning. El reporte explica por qué el audio largo fallaba los health checks del balanceador y cómo corregirlo.
Aspectos clave
- vLLM con paralelismo de tensores
- Análisis documentado de fallas
- Prueba completa por unos 13 dólares