RTX 3050 Ti 4GBノートで動かしている音声チャットサーバーにQwen3.8-Omni-Flashを導入した。ModelScope APIでの音声直接入力でSTTとLLMをまとめ、CPU常駐のQwen3-ASRを外してサーバープロセスのメモリを1.3GBから118MBへ削減。アイドル復帰待ちの解消と応答速度を実測した。
資格試験教科書のPDF抽出テキストをQwen3.8 Max previewで整形し、RunPodの4090上のIrodori-TTS 5プロセスで素読み15時間と掛け合い23時間の音声教材を生成した。reasoning_effortの18倍高速化、CUDA故障ホストの切り分け、実効13倍速の並列構成まで全部書く。