技術2026年7月19日(日)約5分RTX3050Ti 4GBでSTT+LLM+TTSサーバーを立てる音声を受け取って返答音声で返すサーバーをRTX 3050 Ti 4GBの一台構成で組んだ。kotoba-whisperとQwen3-ASR-0.6BのSTT比較、文単位ストリーミングTTS、フィラー音声で待ち時間を埋めた設計、実測タイムラインまでまとめた。QwenTTSSTT音声合成音声認識VPSTailscale実験
技術2026年4月30日(木)更新約9分NIIの48,000時間音声音響データセットはTTSの材料になるNII/LLMCが公開したCC AudioとArchive.org Audio Datasetを、URLリスト、メタデータ、TTS学習、Embedding解析の違いから読む。AI音声AI音声合成音声認識TTSSTTLLM機械学習
技術2026年1月10日(土)約5分AIと喋れる環境を作る(1)音声API調査編キャラ付けAI+アバター+音声会話を目指して、まずは音声APIを比較調査してみたAI音声合成音声認識TTSSTTGeminiOpenAIChatGPTVOICEVOXGoogle Cloud