A 100M-parameter multilingual TTS model for real-time CPU inference, voice cloning, and 48 kHz stereo generation