이 페이지는 자연어처럼 보이는 질의를 실제 자유 입력으로 받지 않고, preset이 고정한 widget 묶음을 이용해 대시보드 생성 로직을 검증한다. 즉, "질의 이해 → 집계 → 차트 렌더링" 흐름이 정해진 시나리오에서 정확히 동작하는지 보는 시험이다. 연구개발 목표치는 Dynamic Dashboard 응답 정확도 90% 이상이다. 원본 10,000건 CSV 보기
100개의 canonical query 를 (metric/dimension/period/chart_type/filter_set) 조합으로 만들고, 매 실행마다 표면 표현(NL phrasing/presentation)을 다양화한 variant 로 NL→dashboard spec 생성 경로(offline/replay/live)를 검증한다. 각 query 의 resolved spec 이 canonical 정답과 일치하고 실제 차트가 올바른 데이터를 그렸는지 oracle 로 교차검증한다. Tableau나 외부 BI는 사용하지 않는다. 연구개발 목표치는 dashboard_accuracy >= 0.90이다.
대표 기준은 dashboard_accuracy >= 0.90와 filter_correctness = 1.0를 만족하고, widget_render_success_rate가 충분히 높으며, render_time_ms_p95가 허용 범위 안에 들어오는 것이다. 조건을 모두 만족해야 PASS다.
상단 결과 pane과 최근 runs 표에서 queries / dash_acc / render_ok / filter_ok / p95_ms를 확인할 수 있다. 대표 샘플 대시보드 대신 전체 query dashboard 묶음에 대한 보기/다운로드 링크를 제공한다.
| run_id | preset | status | pass | queries | dash_acc | render_ok | filter_ok | p95_ms | results |
|---|