• RISK SCORE
  • RELIABILITY
  • ADVICE
  • HUMAN

AIによるA/Bテストのピーキングリスク評価の方法

一度接続すれば、あとはエージェントが計算を代行します。エラー率を膨らませることなく、現在のデータで判断を下せるかどうかを検証します。

このページについてAIに聞く

すぐに答え

統計的な妥当性を損なわずに、A/Bテストを早期終了できますか?

目標とするサンプルサイズに達する前に結果を覗き見る(ピーキング)と、偽陽性の確率が高まります。エージェントが今停止した場合の具体的なリスクを算出し、追加で必要なデータ量を示します。統計的な信頼性を明確に把握できます。

リスクチェックによる分析結果

得られる分析内容

AIが実験データを処理し、以下の具体的なインサイトを提供します。

RISK SCORE

数値化されたピーキングエラー

AIが assess_peeking_risk を使用して、現在観察されている効果が偽陽性である確率を算出します。統計的リスクが単一の数値で示されます。

RELIABILITY

信頼水準の確認

エージェントが現在のサンプルサイズと必要閾値を比較します。現在のデータが安定しているか、あるいは単なるノイズであるかを判断します。

ADVICE

テストの次なるステップ

有意差に達するために、実際にあとどれだけのデータが必要かをAIが計算します。目標とする検出力を達成するために必要なサンプルサイズを提示します。

HUMAN

最終的な意思決定

AIは計算結果を提供しますが、そのリスクを取ってビジネスを進めるかはあなたが判断します。統計的エラーと、待機コストを天秤にかけて決定してください。

ワークフロー

データ到着後のAIの動き

エージェントが統計計算の重い処理をすべて引き受けます。

  1. 現状の分析

    エージェントが現在のコンバージョン率、ベースライン、サンプルサイズを確認し、実験の進捗状況を把握します。

    assess_peeking_risk
  2. エラー確率の算出

    早期観測によって第一種の過誤(Type I error)率がどれだけ変動したかを、AIが計算します。

    assess_peeking_risk
  3. 必要量の予測

    意図した統計的検出力を回復するために、残りのサンプルサイズがどれくらい必要かを特定します。

    assess_peeking_risk
  4. 結果の要約

    エージェントが統計的な出力を、実験を継続すべきか停止すべきかを示す分かりやすいレポートに変換します。

    assess_peeking_risk

試してみる

以下のプロンプトをコピーして開始

これらのプロンプトをチャットに貼り付けるだけで、評価を開始できます。

出発点

括弧内の詳細は、コンバージョン率や現在のサンプル数など、実際の実験数値に書き換えてください。

AB Test Sample Size Calculator Connector

準備完了です。MCPクライアントを選択し、セットアップ手順に従ってください。

コネクタリンクhttps://edge.vinkius.com/vk_preview_r2w7FicRhYLb2yLUrh65lss0cEO4Bcdo5mApGeZ1/mcp

Claude Desktop

以下の手順で数秒で接続できます。

  1. 1In Claude Desktop, open Settings → Connectors.
  2. 2Click “Add custom connector” and paste the connector link above as the remote MCP server URL.
  3. 3Click Add and start a new chat — AB Test Sample Size Calculator capabilities are ready to use.
設定 · claude_desktop_config.jsonコピー
{
  "mcpServers": {
    "ab-test-sample-size-calculator-mcp": {
      "url": "https://edge.vinkius.com/vk_preview_r2w7FicRhYLb2yLUrh65lss0cEO4Bcdo5mApGeZ1/mcp"
    }
  }
}
チャットにコピー04
  • 現在のテストのピーキングリスクを評価してください。ベースラインのコンバージョン率は5%、バリアントは5.5%、各グループのサンプルサイズは1,200です。

  • 実験を早期終了したいと考えています。現在のサンプルサイズ5,000で、偽陽性を避けるのに十分かどうか確認してください。

  • 現在の結果に基づき、このテストで信頼水準95%に達するために必要な追加ユーザー数を計算してください。

  • このスプレッドシートの実験データに対してピーキングリスクチェックを実行してください。現在のリフトは10%、各バリアントのサンプル数は800です。

  • Claude
  • ChatGPT
  • Cursor
  • VS Code
  • Windsurf
  • Claude Code
  • JetBrains
  • Cline

ここから始める

AB Test Sample Size Calculatorを接続して、すぐに質問を開始しましょう。

MCPをお好みのクライアントに接続してください。接続完了後、エージェントはすぐにあなたのデータに対して統計チェックを実行できるようになります。

AB Test Sample Size CalculatorをAIに接続する

FAQ

機能の詳細

  • 01

    AIがテストツール内の実験設定を変更することはありますか?

    いいえ。AIはデータの読み取りと計算のみを行います。実行中の実験を変更したり、外部プラットフォームの設定を書き換えたりすることはできません。

  • 02

    リスクが高い場合、AIが自動的にテストを停止しますか?

    いいえ。AIはリスク評価と計算結果を提供しますが、テストを停止するか継続するかを最終決定するのはユーザー自身です。

  • 03

    正確なチェックを行うには、どのようなデータが必要ですか?

    ベースラインのコンバージョン率、観測されたリフト、各バリアントの現在のサンプルサイズ、および希望する有意水準を提供する必要があります。

  • 04

    AIは統計的なエラーを修正できますか?

    いいえ。エラーが発生していることを特定し、それを修正するためにどれだけの追加データが必要かを伝えることしかできません。

  • 05

    異なる信頼水準にはどのように対応しますか?

    ユーザーが指定したパラメータに基づき、選択された信頼水準に応じた具体的なリスクを計算します。

  • AB Test Sample Size Calculatorについて他に質問がありますか?コネクターのページで回答しています。 AB Test Sample Size Calculatorコネクターの全機能を見る

『AB Test Sample Size Calculator』を Claude、Cursor、ChatGPT などに接続