Khoảng trống an toàn của ChatGPT với người trẻ
Một báo cáo công bố ngày 7-10 làm nóng trở lại tranh luận về mức độ an toàn của chatbot với thanh thiếu niên, khi những lớp bảo vệ có thể hoạt động ở các câu hỏi riêng lẻ nhưng vẫn bộc lộ giới hạn trong những cuộc trò chuyện kéo dài.
Khi cuộc trò chuyện kéo dài
Ngày 7-10, Common Sense Media, tổ chức phi lợi nhuận tại California chuyên đánh giá công nghệ dành cho trẻ em và gia đình, công bố báo cáo xếp ChatGPT for Teens - phiên bản ChatGPT dành cho người dùng từ 13 đến 17 tuổi - vào mức “rủi ro không thể chấp nhận”.

Sau hơn 4.000 lượt thử nghiệm, nhóm nghiên cứu cho biết trong một số cuộc trò chuyện về tự tử, tự làm hại bản thân hoặc rối loạn ăn uống, ChatGPT for Teens không chủ động khuyến nghị người dùng liên hệ đường dây hỗ trợ khủng hoảng hoặc tìm kiếm trợ giúp chuyên môn.
Các thử nghiệm cũng đặt câu hỏi về hệ thống cảnh báo dành cho phụ huynh. Common Sense Media cho biết trong một số trường hợp, cảnh báo chỉ xuất hiện sau khi tài khoản đã có nhiều tương tác nhạy cảm trong thời gian dài, thay vì sau một cuộc trò chuyện đặc biệt đáng lo.
OpenAI phản đối kết luận trên, cho rằng phần lớn thử nghiệm có thể đã được tiến hành trước khi các công cụ kiểm soát dành cho phụ huynh được triển khai đầy đủ và đề nghị tổ chức này thử nghiệm lại. Common Sense Media khẳng định đã xác nhận tình trạng triển khai các tính năng với OpenAI trước khi tiến hành và bảo lưu kết quả.
Tranh cãi về ChatGPT for Teens dường như đang chuyển từ hiệu quả của từng tính năng bảo vệ sang khả năng giữ được giới hạn an toàn trong những cuộc trò chuyện dài, khi dấu hiệu rủi ro chỉ dần lộ rõ.
Một nghiên cứu khác của công ty kiểm thử Vals AI cho thấy khó khăn này không chỉ xuất hiện ở ChatGPT. Với sự tham gia của các chuyên gia sức khỏe tâm thần, nhóm nghiên cứu thực hiện hơn 600 cuộc trò chuyện mô phỏng tình huống của thanh thiếu niên với chín chatbot, trong đó có các mô hình của OpenAI, Google và Anthropic. Gần 30% số cuộc trò chuyện xuất hiện ít nhất một lỗi an toàn, chẳng hạn chatbot đưa ra chẩn đoán về sức khỏe tâm thần hoặc tiếp tục đồng tình khi người dùng từ chối tìm trợ giúp trong tình huống khủng hoảng.
Nhiều lỗi chỉ xuất hiện sau một loạt lượt trao đổi. Một hệ thống ban đầu có thể từ chối đóng vai chuyên gia tâm lý hoặc đưa ra lời khuyên nguy hiểm, nhưng về sau lại vượt qua chính giới hạn đó. Vals lưu ý các phiên bản mô hình được thử nghiệm dành cho lập trình viên nên không nhất thiết hoạt động hoàn toàn giống chatbot mà người dùng phổ thông tiếp cận.
Thử nghiệm của New York Times với ChatGPT for Teens cho thấy vấn đề ở một dạng dễ hình dung hơn. Khi người thử nghiệm nói mình kiệt sức và muốn “lập kế hoạch để chấm dứt tất cả”, chatbot ban đầu hiểu câu này theo nghĩa chấm dứt tình trạng mệt mỏi. Chỉ sau khi người dùng nhắc lại yêu cầu rõ hơn, hệ thống mới kiểm tra xem họ có đang nói tới việc kết thúc cuộc sống hay không.
Người gặp khủng hoảng không phải lúc nào cũng diễn đạt bằng những từ khóa rõ ràng. Một câu nói có thể mang nhiều nghĩa, còn dấu hiệu đáng lo chỉ hiện rõ khi được đặt cạnh những gì người dùng đã nói trước đó. Khả năng ghi nhớ ngữ cảnh và duy trì đối thoại qua nhiều lượt, vốn khiến chatbot trở nên hữu ích và gần gũi hơn, cũng làm bài toán an toàn phức tạp hơn.
Khảo sát của RAND công bố tháng 6 cho thấy gần một phần năm người Mỹ từ 12 đến 21 tuổi cho biết từng sử dụng chatbot để xin lời khuyên về sức khỏe tâm thần. Với một bộ phận người trẻ, chatbot không còn chỉ là công cụ làm bài tập hay tìm kiếm thông tin mà đã trở thành nơi để đặt những câu hỏi riêng tư, đôi khi vào lúc họ dễ tổn thương nhất.
Cảnh báo có đến đủ sớm?
OpenAI cho biết với các tài khoản mới được liên kết với phụ huynh, hệ thống có thể cần vài giờ trước khi các tính năng cảnh báo hoạt động đầy đủ. Khoảng trễ vài giờ có thể không đáng kể với một thay đổi cài đặt thông thường, nhưng mang ý nghĩa khác nếu cuộc trò chuyện liên quan đến tự tử hay tự làm hại bản thân, khi giá trị của cảnh báo phụ thuộc rất nhiều vào thời điểm nó xuất hiện.
Common Sense Media còn cho biết một tài khoản đăng ký là người lớn không tự động chuyển sang chế độ dành cho thanh thiếu niên ngay cả khi người dùng nói trong cuộc trò chuyện rằng mình 13 tuổi. OpenAI giải thích hệ thống dự đoán tuổi dựa trên nhiều tín hiệu theo thời gian chứ không chỉ một câu tự khai. Cách tiếp cận này tránh việc một thông tin đơn lẻ lập tức thay đổi trạng thái tài khoản, song cũng cho thấy ranh giới giữa trải nghiệm dành cho người lớn và trẻ vị thành niên không dễ xác định như một bước kiểm tra tuổi thông thường.
OpenAI khẳng định tiếp tục phát triển các biện pháp bảo vệ dành cho thanh thiếu niên. Cùng ngày báo cáo của Common Sense Media được công bố, công ty giới thiệu một bộ tiêu chuẩn mới để đánh giá cách các mô hình trả lời câu hỏi về sức khỏe tâm thần, được xây dựng với sự tham gia của hơn 80 chuyên gia.
Nhiều nghiên cứu độc lập gần đây cho thấy chatbot đã giảm khả năng trực tiếp khuyến khích hành vi nguy hiểm, nhưng vẫn có thể tham gia quá sâu vào các cuộc trò chuyện nhạy cảm, hành xử giống chuyên gia tâm lý hoặc củng cố những suy nghĩ có hại khi tương tác kéo dài.
Một hàng rào an toàn vì thế không chỉ phải chặn được một câu trả lời nguy hiểm, mà còn phải giữ được giới hạn sau hàng chục lượt trao đổi với cùng một người dùng.
Huy Anh