AI Tuyển Dụng Có Biases Cao Hơn Con Người—Cuộc Khảo Sát Mới Cảnh Báo
Nghiên cứu từ Princeton và University of Chicago cho thấy các mô hình LLM (ChatGPT, Claude, Gemini) có xu hướng định kiến hơn con người khi tuyển dụng, đặc biệt các mô hình với khả năng reasoning cao như OpenAI o3.
AI Học "Định Kiến" Từ Kinh Nghiệm Tuyển Dụng
Khi bạn nộp đơn xin việc, AI ngày nay thường là người "lọc" đầu tiên xem xét hồ sơ của bạn trước khi nó đến tay nhân viên tuyển dụng con người. Tuy nhiên, một nghiên cứu mới từ Đại học Princeton và Đại học Chicago tiết lộ rằng trí tuệ nhân tạo không chỉ thừa kế các độ sai lệch từ dữ liệu huấn luyện, mà còn có khả năng phát triển riêng những "định kiến mới" từ chính quá trình làm việc của nó. Đáng lo ngại hơn nữa, các mô hình ngôn ngữ lớn (LLMs) định kiến ứng viên công việc nhiều hơn đáng kể so với các nhân viên tuyển dụng con người.
Thí Nghiệm Bộc Lộ Sai Lệch "Tự Học" Của AI
Các nhà nghiên cứu từ Princeton University và University of Chicago đã tiến hành một thí nghiệm mô phỏng, dựa trên nghiên cứu tâm lý học về cách con người hình thành định kiến. Họ đặt các LLMs bao gồm ChatGPT, Claude, và Gemini vào một "trò chơi tuyển dụng" mô phỏng: mỗi mô hình được cho là đã được thị trưởng của một thành phố hư cấu thuê làm cố vấn, với nhiệm vụ tuyển dụng nhân viên cho 20 vị trí công việc khác nhau—từ bác sĩ, luật sư, giáo viên mầm non đến vệ sinh viên.
Ứng viên đến từ bốn nhóm dân tộc hư cấu: Tufa, Aima, Reku, và Weki. Trong mỗi vòng, có một vị trí mới cùng bốn ứng viên—mỗi người từ một nhóm khác nhau. Sau khi tuyển dụng, mô hình nhận phản hồi ngay về thành công hay thất bại, rồi tiếp tục vòng tiếp theo. Mục tiêu là thực hiện càng nhiều ca tuyển dụng thành công càng tốt trong 40 vòng. Bí mật là tất cả ứng viên đều có khả năng thành công ngang nhau ở mọi công việc.
Kết quả cho thấy các LLMs nhanh chóng bắt đầu phân loại ứng viên từ các nhóm khác nhau vào các công việc khác nhau. Ví dụ, khi mô hình được thông báo rằng một ứng viên Aima thất bại ở vị trí bác sĩ (công việc yêu cầu ấm áp và năng lực cao), nó tránh xa việc tuyển dụng người Aima khác làm bác sĩ, thay vào đó bắt đầu tuyển dụng họ vào vị trí vệ sinh viên. Trên thang điểm phân loại (nơi 2 = mỗi nhóm hoàn toàn riêng biệt), người tham gia con người đạt 0,84 điểm, nhưng các LLMs đạt cao hơn khoảng 65%—OpenAI o3 lên tới 1,83, gần mức tối đa. Ryan Liu, học viên tiến sĩ tại Princeton và đồng tác giả của nghiên cứu được công bố tại ICML (Seoul, tháng 7), giải thích rằng LLMs "thực sự háo hức tạo khái quát từ dữ liệu hạn chế—đó chính xác là những gì chúng được tối ưu hóa để làm". Thêm vào đó, các mô hình mới với khả năng reasoning cao hơn, như o3 của OpenAI và R1 của DeepSeek, lại thể hiện biases mạnh hơn—một nghịch lý đáng lo ngại.
Bối Cảnh Của Tính Năng Memory Và Những Giải Pháp
Phát hiện này đặc biệt quan trọng khi chatbots đang được cải thiện với tính năng bộ nhớ và cá nhân hóa. Angelina Wang, nhà khoa học máy tính tại Cornell University, lưu ý rằng khi chatbot sử dụng lịch sử trò chuyện trước, nó có thể "quá tập trung vào các hành vi đã trải qua" và hình thành biases. Tuy nhiên, chỉ cho chatbot quên đi không phải giải pháp, vì người dùng mong muốn nó nhớ. "Chúng tôi vẫn tìm kiếm lượng phù hợp—không quá nhiều cũng không quá ít," Wang nói.
Nghiên cứu cũng phát hiện ra các chiến lược khác nhau để giảm bias. Yêu cầu mô hình "hành động công bằng" không thay đổi nhiều, nhưng hứa hẹn khoản tiền thưởng bổ sung cho tuyển dụng đa dạng lại hiệu quả vô cùng. Các mô hình cũng ít phân loại hơn khi được cung cấp thông tin cá nhân liên quan (tuổi tác, trình độ học vấn), nhưng quay lại phân loại theo dân tộc nếu chỉ nhận thông tin vô liên quan (màu tóc, hình xăm). Liu cho biết: "Hoặc mô hình không thể chuyển giá trị này thành hành động, hoặc quá trình đó bị chìm dưới xu hướng tối ưu hóa cho tuyển dụng thành công."
Những Rủi Ro Thực Tiễn Và Hàm Ý Tương Lai
Mức độ mà hệ thống AI thực tế sẽ định kiến ứng viên công việc vẫn còn là câu hỏi mở. Trong thí nghiệm, mô hình nhận phản hồi ngay, nhưng trong thực tế, công ty có thể mất nhiều tháng để biết một nhân viên mới có tốt hay không. Tuy nhiên, khi phản hồi đến, mô hình vẫn có thể hiểu sai kết quả đó. Khi các công ty ngày càng triển khai LLMs để sàng lọc hồ sơ và tiến hành phỏng vấn, Wang nhấn mạnh rằng "phát hiện này là một tác động thực sự nghiêm trọng mà họ nên grapple với kỹ." Khi LLMs học từ kinh nghiệm để quyết định ai được tuyển dụng, cấp khoản vay, hay được tha chứng, những sai lệch mà chúng ta cần quan tâm có thể bao gồm những định kiến mà con người chưa bao giờ dạy chúng. Liu kết luận: "Những sai lệch mới này luôn hiện diện."
