同じDeepseekのハーネス、同じ短い指示で: Deepseek-v4-flashのBIABenchスコアは0.52。 Claude Opus 5は0.65。 つまり、16の実際のバイオ画像解析タスク全体で、約50倍の支出をしてもスコアは0.13しか上がらない。 そして、厄介な下位領域はほとんど改善しない。すべてのエージェントで、一部の3D+時系列タスクは0.19未満にとどまる一方、同じモデルを再実行したときのばらつきが、モデルそのものを切り替えた場合を上回ることさえある。 私なら、日常的な大量処理には安価なモデルを使い、不確実なケースは人間または専門ツールに回すだろう。 そして科学の世界では、検証がまだ必要な4.53ドルの回答は、本当の意味で4.53ドルの回答ではない。