Evals
Chọn loại eval để upload golden dataset và chạy đối chiếu với hệ thống thật.
RetrievalSo sánh Dense / Lexical / Hybrid RRF trên golden queries.Không gọi Answer LLMIntentĐộ chính xác phân loại ý định (1.1 / 1.2 / 2 / 3).Gọi pipeline /chat thậtEntityNhận diện tên thuốc + thuộc tính — deterministic.Miễn phí, không gọi LLMEnd-to-endKịch bản đầy đủ: intent + thuốc + trích dẫn + nội dung bắt buộc.Gọi pipeline + LLM-judgeSummary / faithfulnessĐộ trung thực câu trả lời so với văn bản gốc Dược thư.Gọi pipeline + LLM-judge