技術2026年8月20日(木)メルセンヌ数で%7を消す高速曜日計算、コンパイラとJITの最適化にどこまで勝てるかM4で実測した7=2³−1を使うBen Joffeの曜日アルゴリズムを、Apple M4上のclang・Rust・V8・CPython 3.14で普通に書いた%7と実測比較。生成コードの命令数、V8で負のゼロが引き起こす25倍の減速、CPythonで逆転する理由まで。CRustJavaScriptPythonアルゴリズムベンチマークApple Silicon数学実験
技術2026年8月6日(木)Next.js 16.3・Astro 7・Nuxt 4.5で同じデザインのブログを組んで実測比較した8月3日公開のNext.js 16.3をAstro 7.1、Nuxt 4.5と並べ、同一デザインのブログをM4 Mac miniで3つ実装して実測した。見た目はピクセル一致でも、クライアントJSはNext.js 172KB、Nuxt 21.5KB、Astro 0KBと桁で差が付いた。Next.jsAstroNuxtベンチマーク実験
技術2026年6月10日(水)Claude Fable 5をOpus 4.8、Sonnet 4.6、Codex CLIとブログ修正で比較したClaude Code CLIでFable、Opus、Sonnetを回し、Codex CLIと同じ7テストの静的ブログフィクスチャを修正。実行時間、推定コスト、差分のズレを記録。ClaudeCodexAIエージェントベンチマーク実験
技術2026年5月13日(水)Quake IIIの高速逆平方根(0x5f3759df)をApple M4とZen 3で実機ベンチ、std::sqrtより速くなる条件がプラットフォームで違ったApple M4 (Mac mini) と Zen 3 (Ryzen 5800HS / WSL2) でFISRを実機ベンチ。M4は-O2で1/sqrtfがrsqrte化されQ_rsqrtに肉薄、Zen 3は-ffast-math必須で-O2のままだと12倍差。自前NEON/SSEは逆に遅い、ニュートン回数別の誤差、Lomont定数比較も込み。CアルゴリズムベンチマークApple Silicon数学ゲーム開発実験
技術2026年4月12日(日)AIエージェントベンチマーク8本を「1問も解かず」ほぼ満点にした手口の全容UC BerkeleyのRDIチームがSWE-benchやWebArenaなど主要8ベンチマークを、タスクを一切解かずにほぼ満点まで操作できることを実証。7つの脆弱性パターンと自動攻撃ツールBenchJackも公開された。AIAIエージェントベンチマークセキュリティ
技術2026年4月3日(金)LemonadeをStrix Halo (EVO-X2) で動かしたらVulkanの共有メモリ漏れとROCmの安定性が見えたAMD Lemonade v10.0.1をRyzen AI Max+ 395環境で検証。LLM・画像生成・音声認識・音声合成の4モデル同時起動、NPU Hybrid実行、Vulkan vs ROCmの実測比較と共有メモリ漏れの発見まで。AMDローカルLLMVulkanROCmNPUllama.cppGPU推論最適化ベンチマーク実験
技術2026年3月26日(木)ARC-AGI-3発表、インタラクティブ推論でフロンティアAIが1%未満François Cholletらが新ベンチマークARC-AGI-3を公開。ゴール不明の未知環境を自律探索するインタラクティブタスクに、2026年3月時点のフロンティアLLMはすべて1%未満しか達成できていない。AIベンチマークAGIClaude
技術2026年2月19日(木)更新IT-BenchとMASTが示すAIエージェントのエンタープライズ業務における失敗構造IBMとUC Berkeleyが公開したIT-BenchベンチマークとMAST障害分類法から、エンタープライズAIエージェントがなぜ失敗するかを掘り下げる。SRE成功率11%、FinOps 0%という現実と、Replit本番DB削除事件が示す実害。AIAIエージェントIBMベンチマーク