Anima-2.9Bが使ったLLaMA Proの層拡張(コピーした層を挟んで出力をゼロにし、新層だけ学習)をQwen3-0.6B-Baseで再現。自分のブログの技術記事722本を学習させ、新層のみ・LoRA・フルFTで覚えたかと忘れたかをperplexityで比較した。新層だけで学習外の記事は14.7から10.5に下がったが、Wikipedia日本語版は13.5から17.9に上がってフルFTより忘れた。1.7Bでも比率は同じで、Wikipediaを2割混ぜるとほぼ消える。28層で焼いたLoRAの番号付け替えも数字で再現。M1 Max 64GBのMLXで実測。
Liquid AIのLFM2.5-1.2B-JP-202606をM1 Max 64GBで実測。llama.cpp/Ollama/MLXの3系統でデコード速度・JSON構造化・ツール呼び出し・会話のナチュラルさ・長文入力を検証した。Q4_K_Mで208tok/s、Q8_0で157tok/sだがモデル名ハルシネーションが消える差も出た。