← Về danh sách evals

Eval Scorecard

Tổng hợp các con số chính từ 5 loại eval (intent/entity/e2e/summary/ retrieval) đã chạy sẵn trên golden dataset. Không chạy live mỗi lần vào trang — xem "Chạy lại đánh giá" bên dưới để tính lại trước khi trình bày.

Đang tải...

Thẻ Retrieval ở trên chỉ hiện headline (Hit@K của hybrid) trên golden dataset checked-in (5 câu smoke-test, chưa qua dược sĩ review). Để so sánh chi tiết Dense/Lexical/Hybrid theo từng query, hoặc thử một dataset khác không cần commit, dùng trang retrieval riêng.

Chạy lại đánh giá

Gọi pipeline guarded thật cho từng dòng golden — có thể mất vài phút đến nửa tiếng tuỳ số dòng và tốc độ model. Nên chạy trước khi demo, không chạy trong lúc trình bày.