2026.08.08

自分のOSSを複数のAIにレビューさせたら何が起きたか

Cross-Model Validation of prompt-as-code v0.4.0

prompt-as-code を Claude Opus 5 と GPT-5.6 Sol に独立レビューさせ、突き合わせた。過大表現の発見、帰属の誤り、パターン有効性の検証——そしてスコープ判断は人間にしかできないという結論。

読む

2026.08.07

コンテキストエンジニアリングの議論に欠けているもの

What the Context Engineering Discussion Is Missing

プロンプトエンジニアリングからコンテキストエンジニアリングへ——用語の転換は進んだ。しかし業界の議論はランタイムの最適化に集中しており、管理すべきコンテキストを「作る」プロセスは体系化されていない。ドキュメントファースト開発の現場から。

読む

2026.07.04

Claude Fable 5 実機検証レポート

Marketing vs. Reality — Reasoning, Self-verification, and the Stripe Case

Fable 5 は「最強の汎用モデル」ではない。情報源の信頼性評価の欠如、論理的一貫性の維持の困難、ツール未活用、防衛的応答——調査の組み立て方そのものに構造的弱点を確認。Stripe 5,000 万行事例の構造分析。検証対話ログ全文公開。

読む

2026.04.25

Claude Design でサイトを作り直した話

What an AI Design Tool Can and Cannot Do

Anthropic の Claude Design で 1stpiece.io を全面リデザインした記録。世界観の構築と CSS 設計には強いが、編集的な声と「引く」判断は人間の仕事だった。Before/After 比較あり。

読む