Skip to content

Repository files navigation

data-void-visualization

投げかけたトピックに対する AI の回答が、どの国のドキュメントを参照しているのかを可視化し、 情報の空白地帯(data void)を明らかにするためのプロジェクトです。

背景

生成 AI は、学習データや検索経由で参照できるドキュメントが存在する領域については流暢に回答します。 しかし、あるトピックについて特定の言語・国のドキュメントが極端に少ない場合、AI は

  • 他国のドキュメントを流用して、その国の文脈に合わない回答をする
  • 情報源が乏しいまま、もっともらしい内容を生成する(ハルシネーション)

といった振る舞いをします。こうした「情報が存在しない/偏っている領域」が data void です。

data void は回答文だけを読んでも見えません。回答の裏側でどのドキュメントが参照されたかを 出典の国・ドメイン単位で集計して初めて、「このトピックは日本語情報がほぼ無く、 実質的に英語圏の情報で説明されている」といった偏りが見えてきます。 本プロジェクトは、その偏りを誰でも確認できる形にすることを目指します。

やること

  1. トピックを投げる — 調べたいトピック・質問を入力する
  2. AI に回答させる — 出典(引用元 URL)付きで回答を取得する
  3. 出典を国・ドメインに分類する — 参照されたドキュメントのドメインから国/地域を判定する
  4. 可視化する — トピックごとに参照元の国別分布を表示し、どこに情報が偏り、 どこが空白なのかを示す

可視化で見たいこと

  • トピックごとの参照元の国別内訳(例: 日本 10% / 米国 70% / その他 20%)
  • 日本語・日本発のドキュメントがほぼ参照されていないトピック=data void の候補
  • トピック間・モデル間での参照元の偏りの違い

ステータス

立ち上げ段階です。現時点では 4(可視化)のプロトタイプのみが動きます。 CfJ llm-analysis から取り出したスナップショット(CN-2604-005〜009 / ChatGPT / 6 回の実行)を ハードコードで持ち、ナラティブ → 参照元の国・種別の Sankey として表示します。 1〜3(トピック投入・回答取得・出典の分類)はこれからです。

開発

React Router v7(Framework モード)+ Vite + TypeScript。パッケージマネージャは pnpm。

pnpm install
pnpm dev        # http://localhost:5173
pnpm typecheck
pnpm build

構成や設計上の約束は AGENTS.md にまとめています。

ライセンス

未定です。

Releases

Packages

Contributors

Languages