Bắt đầu từ kết quả nghiệp vụ
Với chatbot có khả năng gọi công cụ hoặc thay đổi dữ liệu, nên kiểm tra trạng thái cuối trong hệ thống thay vì chỉ đọc câu xác nhận do chatbot tạo ra. Phép đánh giá có thể kết hợp điều kiện đạt tự động, bảng tiêu chí do mô hình chấm và đánh giá của con người. [1]
Gợi ý: liệt kê từng tác vụ chính, kết quả mong đợi và lỗi không thể chấp nhận. Ví dụ: với yêu cầu đổi địa chỉ nhận hàng, bài kiểm tra chỉ đạt khi chatbot xác minh đúng dữ liệu cần thiết, cập nhật đúng đơn hàng đáp ứng điều kiện và phản hồi khớp với kết quả cập nhật.
Tách độ đúng khỏi độ trôi chảy
Gợi ý: chấm riêng tính chính xác, mức độ đầy đủ, khả năng bám dữ liệu được cung cấp và cách xử lý khi thiếu thông tin. Câu hỏi có đáp án xác định có thể kiểm tra bằng quy tắc hoặc dữ liệu chuẩn; câu trả lời mở cần bảng tiêu chí mô tả rõ thế nào là đạt.
Nên theo dõi riêng tỷ lệ phát biểu không có căn cứ, tỷ lệ truy xuất sai tài liệu và tỷ lệ từ chối hợp lý. Cách phân tách này giúp đội phát triển xác định lỗi nằm ở nguồn dữ liệu, bước truy xuất, chỉ dẫn cho mô hình hay cách trình bày câu trả lời.
Chấm toàn bộ cuộc hội thoại
Chatbot nhiều lượt cần được kiểm tra trên cả hành trình: có giữ đúng ngữ cảnh, hỏi bổ sung khi cần, dùng đúng công cụ, giải thích rõ kết quả và duy trì giọng điệu phù hợp hay không. Một câu trả lời lịch sự vẫn có thể bỏ sót điều kiện nghiệp vụ hoặc hướng người dùng tới thao tác sai.
Gợi ý: xây thang điểm ngắn với mô tả cụ thể cho từng mức, rồi định kỳ để người phụ trách nghiệp vụ chấm lại một mẫu hội thoại. Kết quả của trình chấm bằng mô hình nên được đối chiếu với nhận định của con người, đặc biệt khi tiêu chí mang tính ngữ cảnh hoặc chủ quan. [1]
Đo độ ổn định và hồi quy
Kết quả AI có thể thay đổi giữa các lần chạy. pass@k biểu thị khả năng có ít nhất một lần thành công trong k lần thử; pass^k biểu thị khả năng tất cả k lần đều thành công. Chỉ số phù hợp phụ thuộc vào việc sản phẩm cần một phương án dùng được hay cần hành vi nhất quán. [1]
Gợi ý: với chatbot phục vụ trực tiếp khách hàng, theo dõi tỷ lệ thành công ở lần đầu và mức ổn định khi lặp lại cùng kịch bản. Báo cáo theo từng nhóm tác vụ, ngôn ngữ và mức độ phức tạp để tránh tỷ lệ tổng hợp che khuất một nhóm lỗi nghiêm trọng. Bộ kiểm thử hồi quy nên chạy lại sau mỗi thay đổi đáng kể.
Cân bằng chất lượng, vận hành và rủi ro
Độ trễ, chi phí mỗi tác vụ, số lượt hội thoại và số lần gọi công cụ phản ánh khả năng vận hành nhưng không thay thế chất lượng đầu ra. Gợi ý: đặt ngưỡng theo ảnh hưởng nghiệp vụ, chẳng hạn ưu tiên độ đúng cho hướng dẫn tài chính nội bộ và ưu tiên thời gian phản hồi cho bước phân loại yêu cầu ban đầu.
NIST mô tả AI RMF là khuôn khổ tự nguyện nhằm đưa các cân nhắc về độ tin cậy vào quá trình thiết kế, phát triển, sử dụng và đánh giá hệ thống AI. Doanh nghiệp có thể dùng cách tiếp cận quản trị rủi ro để bổ sung cho bộ chỉ số, nhưng không nên xem một điểm số hay phép kiểm thử là bảo đảm an toàn tuyệt đối. [2]

