Đánh giá model LLM

So sánh các model sinh kịch bản bản tin qua ĐÚNG validator production: hợp đồng 3 tầng (schema → grounding → semantics). Mỗi model chạy N lần trên cùng bộ dữ liệu, chấm bằng stockflow.evaluation.

Phương pháp chấm

① Schema

JSON đúng lược đồ Pydantic

Output phải parse được thành NewsScript (đủ trường intro/lines/disclaimer, đúng kiểu). Hỏng schema → dừng, hai tầng sau không chấm.

② Grounding

Số liệu khớp dữ liệu thật

Mọi con số (OFI/RVOL) trong kịch bản phải khớp features của mã, không bịa. Chống ảo giác số.

③ Semantics

Không cụm cấm §2.0

Không mô tả sai bản chất tín hiệu ("dòng tiền", "cá mập") và không văn phong tư vấn/khuyến nghị.

So sánh

bộ dữ liệu:

Tỷ lệ vượt hợp đồng

contract_pass_rate · khoảng tin cậy Wilson 95%
≥ 80%< 80%│ = khoảng tin cậy Wilson

Độ trễ trung vị

latency_median_s · thấp hơn = nhanh hơn

Bảng đầy đủ