모델 검증·평가
/model-assessmentNEW기능 설명
학습된 영상 모델의 validation 설계, task에 맞는 held-out metric(Dice + HD95, AUROC + AUPRC, FROC, calibration), uncertainty/OOD, explainability를 각각 게이트로 점검.
주요 기능
- ✓Split-leakage 게이트로 환자 disjointness 증명
- ✓bootstrap CI를 포함한 task별 metric, 실행된 코드에서만 산출
- ✓측정되지 않은 uncertainty coverage·검증되지 않은 OOD 가드 적발
- ✓Grad-CAM sanity check + ground truth 대비 정량 localization
이 스킬 설치
git clone https://github.com/Aperivue/medsci-skills.git
mkdir -p ~/.claude/skills
cp -r medsci-skills/skills/model-assessment ~/.claude/skills/관련 스킬
논문에 근거한 의료영상 아키텍처 선택, 이어서 실제 repository·checkpoint의 licence, version pin, weight provenance, benchmark 중복 점검.
Model Scaffold/model-scaffold의료영상 task(segmentation, classification, detection, synthesis, self-supervised pretraining, pretrained backbone fine-tuning)를 위한 재현 가능하고 바로 실행되는 PyTorch 학습 레포를 생성합니다. 환자 단위 seed-locked split, train/evaluate 스크립트, Methods stub을 함께 제공하며, MONAI / nnU-Net을 통합할 뿐 재구현하지 않습니다.
Model Card & Datasheet/model-card엔지니어가 만든 모델이 갖춰야 할 문서를 생성합니다. Model Card(Mitchell et al. 2019), 데이터셋 Datasheet(Gebru et al. 2021), METRIC 데이터 품질 점검을 사용자가 제공한 사실만으로 채운 뒤, 필수 항목이 모두 채워졌는지 completeness 게이트로 검증합니다.
LLM/MLLM Evaluation/mllm-eval임상 task(보고서 생성, visual question answering, 임상 텍스트 추출)에 대해 LLM 또는 MLLM을 모델 무관하게 평가하는 하네스입니다. adjudicated reference, 임상 효용 metric(RadGraph-F1 / CheXbert-F1), faithfulness, contamination, prompt sensitivity, reader study를 다룹니다.