65018.95
+882.70(+1.38%)
Claude Sonnet
▲ 上昇
確信度 45%
上昇 54% / 下落 46%
詳細を見る →
Gemini Flash
▼ 下落
確信度 60%
上昇 46% / 下落 54%
詳細を見る →
GPT (Mid Tier)
▲ 上昇
確信度 35%
上昇 52% / 下落 48%
詳細を見る →
▶ AI予測の詳細を見る
3 AI の方向・上昇確率・確信度と、判断の要旨
// AI 市場予測 公開ベンチマーク
$ 主要 AI モデルに 完全同一プロンプト・同一市場データ・同一時刻 で為替(ドル円)と株価指数(日経平均・S&P500)の方向予測を実行させ、結果を機械採点する公開Arena。
# 投資助言ではありません。AI の予測精度を検証する目的のベンチマークです。
// 結論
3つの AI に毎営業日「上」か「下」の二択で答えさせ、翌営業日の終値と突き合わせています。 的中率は採点のたびに更新しています。
Claude Sonnet
61.5%
13 回中 8 回的中
Gemini Flash
53.8%
13 回中 7 回的中
GPT (Mid Tier)
53.8%
13 回中 7 回的中
現在の暫定トップは Claude Sonnet の 61.5%です。
これは途中経過です。現在 1モデルあたり 13 件で、この件数では的中率は 1件増えるごとに大きく動き、順位も明日にも入れ替わります。目安として 250 件(残り約 79 営業日)で、 的中率の振れ幅がおおむね ±6 ポイントに収まります。
// 本日のAI予測一覧
翌営業日方向 · Claude / GPT / Gemini · 同一プロンプト
▲ ▼ 予測方向
▲上昇 ▼下落 の二択。中立・保留の選択肢はなく、各AIが必ずどちらかを選びます。
% 確信度
AIが自身の予測にどれだけ自信があるかを 0–100% で自己申告。80以上で外すと過信ペナルティ。
↑ ↓ 上昇確率
上で終わる確率をAIが%で申告。下落確率はその裏返し(100 − 上昇確率)。
判定方法
翌営業日の終値が基準価格より高ければ上昇、低ければ下落。閾値はありません。
65018.95
+882.70(+1.38%)
Claude Sonnet
▲ 上昇
確信度 45%
上昇 54% / 下落 46%
詳細を見る →
Gemini Flash
▼ 下落
確信度 60%
上昇 46% / 下落 54%
詳細を見る →
GPT (Mid Tier)
▲ 上昇
確信度 35%
上昇 52% / 下落 48%
詳細を見る →
▶ AI予測の詳細を見る
3 AI の方向・上昇確率・確信度と、判断の要旨
7637.76
+85.95(+1.14%)
Claude Sonnet
▲ 上昇
確信度 45%
上昇 56% / 下落 44%
詳細を見る →
Gemini Flash
▲ 上昇
確信度 60%
上昇 55% / 下落 45%
詳細を見る →
GPT (Mid Tier)
▼ 下落
確信度 56%
上昇 48% / 下落 52%
詳細を見る →
▶ AI予測の詳細を見る
3 AI の方向・上昇確率・確信度と、判断の要旨
155.934
-0.309(-0.20%)
Claude Sonnet
▼ 下落
確信度 45%
上昇 42% / 下落 58%
詳細を見る →
Gemini Flash
▼ 下落
確信度 65%
上昇 42% / 下落 58%
詳細を見る →
GPT (Mid Tier)
▼ 下落
確信度 58%
上昇 44% / 下落 56%
詳細を見る →
▶ AI予測の詳細を見る
3 AI の方向・上昇確率・確信度と、判断の要旨
稼働状態
オンライン
シーズン
2026-06
AIモデル
3 機
対象市場
3 市場
累計予測
48
最新ジョブ
ニュース取得 · 22分前
プロンプト
v2.1
採点ルール
v2.0
採点方法
方向的中 +1.0 / 方向外し -1.0 / 過信ペナルティ -1.0(確信度80以上で外し時)。上下の二択のみ
実行スケジュール
平日 7:00 JST 予測 → 7:30 採点 · ツール=オフ · 推論=最小(low)
再現性の担保
入力スナップショット保存 · プロンプト全文を公開 · AI 生原文を DB 保存
// AI 市場予測検証の必要性
ChatGPT や Claude、Gemini といった生成 AI に「ドル円は明日上がりますか?」と聞けば、 それぞれが流暢に回答を返します。しかし、その予測が実際にどれだけ当たるのか、誰も客観的に測っていません。各社のマーケティング資料や個人の体感ベースの感想は溢れているものの、 完全同一の条件で並べた公開ベンチマークはほぼ存在しないのが現状です。
Shinden は、この空白を埋めるために設計された公開検証 Arena です。 毎日 7:00 JST、Anthropic Claude・OpenAI GPT・Google Gemini の3社に完全同一プロンプト・同一市場データ・同一時刻で為替と株価指数の方向予測を行わせ、結果を機械採点して蓄積します。 すべてのプロンプト・採点ルール・生 AI 出力は公開されており、第三者が検証可能です。
予測の精度を方向の的中率だけでなく、確信度・過信率も合わせて測定することで、 「自信過剰なのに当たらない AI」「謙虚で当たる AI」のような人間味のある比較が可能になります。
// 本サイトでわかること
// 採用 AI モデル(中間ティア)
各社のフラグシップではなく、コスト・性能のバランスが取れた中間ティア(標準モデル)を採用。一般ユーザーが日常的に使う価格帯のモデルが、現実の市場でどれだけ通用するかを検証します。
// 対象市場
日本のトレーダーに馴染みの深い3市場を選定。為替(FX)・国内株価指数・米国株価指数の代表をそれぞれ1つずつ。 値動きの性質が異なる3市場に同じ問いを投げることで、AI の得手不得手が見えるようにしています。
// よくある質問
A.Claude・GPT・Gemini の主要 AI 3社に毎日同条件で為替(ドル円)と株価指数(日経平均・S&P500)の方向予測を行わせ、後日結果を機械採点する公開ベンチマークです。投資助言ではなく、AI モデルの予測精度を検証する目的の公開 Arena です。
A.意味があるかどうかを検証するためのサイトです。各社が「○○できる」とアピールする中、同条件で並べた客観データはほぼ存在しません。Shinden は同一プロンプト・同一データで毎日測定し続けることで、AI モデルの市場予測能力に対する客観的な根拠を蓄積します。
A.本サイトは投資助言・売買推奨を目的としていません。掲載される予測は AI モデルの予測能力を検証するためのログであり、投資判断は利用者ご自身の責任で行ってください。
A.平日朝7:00 JST に予測を実行、翌営業日朝7:30 JST に前日予測を採点します。当日の予測はトップページ「今日の対戦カード」で、過去の予測履歴と採点結果は市場別・モデル別ページで確認できます。
A.AIモデル予測精度ランキングで通算成績を公開しています。サンプル数 N≥30 で統計的に意味のある比較になります。それまでは目安としてご覧ください。
A.AI が自身の予測にどれだけ自信があるかを 0–100% で自己申告した値です。確信度80以上で予測が外れた場合、追加で「過信ペナルティ -1.0」が課されます。詳細は用語集をご覧ください。
A.方向の的中(+1.0)・横ばい的中(+0.8)・方向外し(-1.0)・過信ペナルティ(-1.0)を機械的に合算して総合スコアを計算します。方向採点は実価格との比較のみで AI を使わないため、恣意性はありません。(説明品質のクロス採点は2026年6月に運用コスト削減のため終了しました。)