Qwen3-TTS Megakernel
Persistent-kernel CUDA megakernel repurposed as the talker decoder for Qwen3-TTS (0.6B). 47 ms median TTFB and 0.145 RTF on RTX 5090 — 5× faster than the stock pipeline. Diagnosed and fixed a grid-barrier race deadlock; verified numerical parity against HF reference.