← Về trang tra cứu

Evals

Chọn loại eval để upload golden dataset và chạy đối chiếu với hệ thống thật.

Scorecard tổng hợpTổng hợp con số chính của cả 5 loại eval bên dưới thành 1 trang xem nhanh — đọc snapshot đã tính sẵn, không chạy live.
RetrievalSo sánh Dense / Lexical / Hybrid RRF trên golden queries.Không gọi Answer LLMIntentĐộ chính xác phân loại ý định (1.1 / 1.2 / 2 / 3).Gọi pipeline /chat thậtEntityNhận diện tên thuốc + thuộc tính — deterministic.Miễn phí, không gọi LLMEnd-to-endKịch bản đầy đủ: intent + thuốc + trích dẫn + nội dung bắt buộc.Gọi pipeline + LLM-judgeSummary / faithfulnessĐộ trung thực câu trả lời so với văn bản gốc Dược thư.Gọi pipeline + LLM-judge