技術2026年3月6日(金)OpenAI GPT-5.3/5.4の連続リリースとSaguaroによる推論高速化GPT-5.3 Instantのハルシネーション削減と安全性退行、GPT-5.4のcomputer use・Tool Search・1Mトークンコンテキスト、そしてSaguaroが実現した推論5倍高速化をまとめた。LLMOpenAIGPT推論最適化Speculative DecodingAI安全性Computer Use
技術2026年3月4日(水)Amazon Bedrock MantleエンジンのOpenAI API互換が一般提供開始、DeepSeekやMistralで既存SDKが使えるAWSのBedrock分散推論エンジンMantleがOpenAI API互換を提供開始。Chat Completions APIとResponses APIに対応し、OpenAI SDKのコードをそのままGoogle/DeepSeek/Mistral等のオープンウェイトモデルに使い回せる。AWSAmazon BedrockOpenAIAPILLM
技術2026年3月1日(日)Qwen 3.5がRadeon 8060Sで全滅した原因はAMDドライバだったQwen 3.5がROCm/Vulkanで動かない原因をCPU推論・llama-server・LM Studioで切り分けた結果、AMDドライバの更新で全て解決した。AILLMローカルLLMAMDllama.cppOllamaLM Studio実験
技術2026年2月28日(土)更新abliteratedモデルをOllamaで動かそうとして全滅した話と、結局公式版で済んだ話huihui-aiのQwen 3.5 abliteratedは全バリアントでゴミトークンを吐いて全滅。GLM-4.7-Flash abliteratedもテンプレート崩壊で使い物にならず、最終的に公式版+thinking無効が正解だった。AILLMOllamaローカルLLMAMDLM StudioVulkanROCm実験
技術2026年2月28日(土)エンコーダーモデル+ローカルLLMでOCR誤字を自動検出・修正するLUKE/BERTのfill-maskファインチューニングから始めて、perplexityベースの誤字検出→Qwen2.5 7Bでの修正判定→不一致時エスカレーションのパイプラインに至るまでの実験ログ。VRAM 8GBのRTX 4060 Laptopで完結する構成。自然言語処理OCR機械学習PythonBERTLUKEOllamaLLMWSL2NDLOCR-Lite実験
技術2026年2月24日(火)Claudeの大規模不正蒸留とSWE-benchの崩壊が同時に来たAnthropicが中国AI3社によるClaude蒸留を告発し、同日OpenAIがSWE-bench Verifiedを廃止。訓練の不正と評価の欠陥が同時に露呈した2026年2月23日の出来事を整理する。AISecurityAnthropicDeepSeekBenchmarkLLMOpenAISWE-bench
技術2026年2月22日(日)更新AIエージェントオーケストレーションClawsとCordAndrej KarpathyがAIエージェントの上位レイヤーとして「Claws」を命名し、June KimはMCPとSQLiteで実装したCordフレームワークで同じ問いに別の角度から答えた。単発実行エージェントから自律的な調整システムへの移行を概念と実装の両面から整理する。AIAIエージェントMCPLLMArchitectureKarpathy
技術2026年2月20日(金)更新LLM推論を高速化するCDLMとAttention Matching KV圧縮Together AIのConsistency DLM(最大14.5倍高速化)と、MIT・HarvardのAttention Matching KV圧縮(50倍圧縮を数秒で)。2026年2月に出た推論コスト削減の2本。AILLM推論最適化KVキャッシュ拡散モデル
技術2026年2月18日(水)NVIDIA Nemotron 2 Nano 9B Japanese - 10B以下で日本語性能トップのソブリンAIモデルNVIDIAがNemotron-Nano-9B-v2-Japaneseを公開した。Nejumi Leaderboard 4の10B以下カテゴリで1位を獲得し、日本語の知識・QA・ツール呼び出しで優れた性能を示す。NVIDIALLMNemotronJapanese AI
技術2026年2月18日(水)Claude Sonnet 4.6リリース - コーディング性能でOpus 4.5を超える場面もAnthropicが中間サイズモデルClaude Sonnet 4.6を発表。Claude Codeでの評価ではユーザーの70%がSonnet 4.5より選好し、Opus 4.5との比較でも59%が選好するという結果が出ている。価格は据え置き。ClaudeAnthropicLLMClaude Code
技術2026年2月15日(日)ローカルLLMをVPN経由で外部API化するTailscale VPNとConoHa VPSを使って、ローカルLLMをインターネットからAPI経由で呼び出せるようにした構成と手順。AILLMTailscaleVPNVPS実験
技術2026年2月15日(日)更新Strix HaloのVRAM・メモリ配分を攻略するGMKtec EVO-X2(Strix Halo)でローカルLLMを動かす際のVRAM/メインメモリ配分問題と解決策。VRAM 8GBでも29.6GBモデルが動いた実証付き。AILLMメモリ最適化AMDLM Studio実験