ClaudeChatGPTPerplexityGeminiMicrosoft CopilotRaycastMeta AIGrokZ.aiQwenKimi
DeepSeekMistralCursorVS CodeWindsurfJetBrainsClineLovableVercel AI SDKLangChain

Agent A/B Test CalculatorをAIで使う。

アカウントを一度接続するだけで、いつも使っているAIに仕事を任せられます。追加の連携開発は不要。データに基づき、エージェントの改善効果を統計的に証明しましょう。

Included with plan

このConnectorについてAIに質問

Vinkiusが開発・運用・ホスティング。

MCP認証済み · 本番環境対応 · Vinkius保証

Waiting for input…

Works with modern AI clients that support MCP, including ChatGPT, Claude, Cursor, and more.

ChatGPTClaudeCursorPerplexityGeminiMicrosoft CopilotRaycastMeta AI

完全セット · 3機能

Agent A/B Test Calculatorの全機能セット。

Agent A/B Test Calculatorに仕事を頼むとき、AIが選べる正確なアクションです。

機能セット01 / 01

01-03

このセットには3機能あります。

Agent A/B Test Calculatorで使える3機能の一部です。

  1. 01

    バリアントのパフォーマンス分析

    複数のAIエージェントのバリアントのパフォーマンスを分析し、統計的な有意差を判定します。p値や信頼区間を算出できます。

  2. 02

    ベイズ確率の計算

    ベイズ分布を用いて、バリアントBがバリアントAよりも優れている確率を算出します。より深い確信度を推定できます。

  3. 03

    テストに必要な要件を推定

    A/Bテストを実施するにあたり、必要なサンプルサイズとテストの期間を事前に計算し、実験計画を立てるのを支援します。

実測値、推定値ではない

平均813ms。本番環境で高速。

Agent A/B Test Calculatorは本番サービスに対して毎日チェックされています。

日次平均最大973ms
8月20日今日
最速日
649ms
最遅日
973ms
14日間の傾向
遅延傾向+37%

クライアントを接続

1つのURL。すべてのクライアント。

Connectorを有効化し、リンクをコピーして、いつも使うクライアントに貼り付けるだけ。3個の機能がすぐに使えます。

プレビューアクセス · プロバイダー認証ではありません

vk_preview_* トークンは Vinkius のプレビューインフラに属します。Claude が Agent A/B Test Calculator のケイパビリティを検出して表示できるようにし、AI の中でその体験を確認できます。

このトークンは Agent A/B Test Calculator のアカウントを認証するものではありません。認証情報や実際のアカウントデータが必要なアクションは、Connector を有効化してサービスを承認するまで実行されない場合があります。

Agent A/B Test Calculator Connector

準備完了です。MCPクライアントを選択し、セットアップ手順に従ってください。

コネクタリンクhttps://edge.vinkius.com/vk_preview_rLQOAZtFk4qc4ty1S7S56y14mXSD5bAfWh5mornv/mcp

Claude Desktop

以下の手順で数秒で接続できます。

  1. 1In Claude Desktop, open Settings → Connectors.
  2. 2Click “Add custom connector” and paste the connector link above as the remote MCP server URL.
  3. 3Click Add and start a new chat — Agent A/B Test Calculator capabilities are ready to use.
設定 · claude_desktop_config.jsonコピー
{
  "mcpServers": {
    "agent-ab-test-calculator-mcp": {
      "url": "https://edge.vinkius.com/vk_preview_rLQOAZtFk4qc4ty1S7S56y14mXSD5bAfWh5mornv/mcp"
    }
  }
}
  • Claude
  • ChatGPT
  • Cursor
  • VS Code
  • Windsurf
  • Claude Code
  • JetBrains
  • Cline

各クライアントの手順ガイドはこちらです。 接続方法

対象ユーザー

Agent A/B Test Calculatorユーザーが任せたい仕事のために。

AIエージェントの改善サイクルを回すプロダクトマネージャーやデータサイエンティストに最適です。エージェントの挙動変更が本当にビジネス成果に結びついているのかを、感覚ではなく統計的な根拠で証明したい方に役立ちます。

  • 01

    プロダクトマネージャー

    エージェントの機能改善の優先順位付けや、新しい挙動の導入効果を検証する際に、客観的なデータ根拠を求めます。

  • 02

    データサイエンティスト

    A/Bテストの設計、サンプルサイズの計算、そしてp値や信頼区間を用いた統計的検証を正確に行う必要があります。

  • 03

    グロースマーケター

    コンバージョン率の微細な差がビジネスに与える影響を最大化するため、統計的に有意な改善点を見つけ出したい方におすすめです。

FAQ

Agent A/B Test Calculatorユーザーからのよくある質問。

  • 01

    この計算機は何を検証するために使えますか?

    主に、複数のAIエージェントのバリアント(AとBなど)のパフォーマンス差が、偶然によるものではなく、統計的に意味のある差であるかを検証するために使えます。

  • 02

    どのようなデータを用意すればいいですか?

    各バリアントの「試行回数(総数)」と「成功回数」のデータが必要です。これらを入力することで、統計的な分析が実行されます。

  • 03

    「統計的有意差」とは具体的にどういう意味ですか?

    統計的有意差とは、観測されたパフォーマンスの差が、単なるランダムな変動ではなく、実際にエージェントの挙動変更によって引き起こされた可能性が高い、ということを意味します。

  • 04

    テストを始める前に、どれくらいのデータが必要か計算できますか?

    はい、estimate_test_requirements機能を使えば、検出したい効果(MDE)と信頼水準から、必要なサンプルサイズやテスト期間を事前に推定できます。

  • 05

    ベイズ確率とp値の違いは何ですか?

    p値は「帰無仮説が正しいと仮定した場合に、これだけの結果が出る確率」を示します。一方、ベイズ確率は「あるバリアントが優れているという事象が、どれだけ確からしいか」という視点から確率を推定します。