摘要與 purpose
所有 workflow 上線前後的統一評測:golden dataset 回歸、幻覺偵測、prompt injection 紅隊、模型/提示詞版本升級 CI 守門。對應 TFDA「獨立性能評估」的院內配套,也是 Codex「模型驗證 SOP」的自動化。
目前狀態
Evidence
Repo implementation/automated-test evidence
已找到 mock runner、20 案合成 golden set、red-team set、gates 與 demo report。
Synthetic evidence
Repo inventory 找到合成 fixtures、mock、golden set、對抗測試或工程 drill,因此最高保守標示為 Synthetic validation/Synthetic verification;本 WP 未重新執行該專案 test suite,也不公開未複驗的 pass count 或 coverage。
Clinical/operational evidence
未找到真實模型或醫師 validation evidence。
External/IRB/regulatory evidence
未找到外部、IRB 或 regulatory review evidence。
Known limitations/evidence gaps
目前只有 SOAP golden set;audit 僅產 JSON;部分統計為簡化實作。
本頁不得被解讀為 clinical deployment、external validation、IRB approval、regulatory review、government endorsement、正式服務或可投入臨床使用。
Governance/human-review boundary
- Engineering owner 對 implementation 與 test claims 負責;clinical/regulatory owner 必須另行核准醫療與法規內容。
- Repo verification 或 synthetic drill 不是 certification decision。
- 研究網路可以執行 certification,但同案 development/consulting/sponsored research/validation 人員必須和 certification review/decision/appeal 分離;Studio 不得審查自己的工作。
- 任何臨床、IRB、TFDA、政府與院內責任仍由其法定或專業 owner 承擔。
Source provenance
| Project README | projects/P-05-clinical-eval-harness/README.md |
|---|---|
| Project source commit | a2185b0 |
| Evidence inventory | docs/website-evidence-inventory.md snapshot 5fdebfe |
| Website generation base | 64f0ba78b11942156f40c18cef3b24489b708f68 |
| Last reviewed | 2026-07-17 |
| Content status | DRAFT |