Anima-2.9Bが使ったLLaMA Proの層拡張(コピーした層を挟んで出力をゼロにし、新層だけ学習)をQwen3-0.6B-Baseで再現。自分のブログの技術記事722本を学習させ、新層のみ・LoRA・フルFTで覚えたかと忘れたかをperplexityで比較した。新層だけで学習外の記事は14.7から10.5に下がったが、Wikipedia日本語版は13.5から17.9に上がってフルFTより忘れた。1.7Bでも比率は同じで、Wikipediaを2割混ぜるとほぼ消える。28層で焼いたLoRAの番号付け替えも数字で再現。M1 Max 64GBのMLXで実測。
ModelScope経由のQwen3.7とAlibaba Cloud Model StudioのQwen3.8で、OpenAI互換chat.completionsのenable_search、DashScopeのsearch_options、Responses APIの組み込みweb_searchツールを比較検証。雑談に検索を混ぜるとreasoning_tokensが10倍以上に跳ね、Qwen3.7-Maxはテキスト専用で画像入力はQwen3-VL系が別に必要と分かるまでを実測した。