ChatGPT và Gemini đều đã có khả năng tiếp nhận hình ảnh, nhưng việc nhận ra một vật thể hay hiểu chính xác nội dung trong ảnh lại là vấn đề khó hơn, đòi hỏi chatbot phải xử lý tốt cả hình ảnh lẫn ngữ cảnh.
Để xem chatbot nào thực sự có khả năng “nhìn” thế giới xung quanh tốt hơn, CNET đã thực hiện một loạt bài kiểm tra với những hình ảnh khá đời thường. Cả hai chatbot đều nhận cùng một bức ảnh và được đưa ra cùng một yêu cầu, qua đó tạo điều kiện để so sánh trực tiếp khả năng nhận diện và phân tích hình ảnh của mỗi nền tảng.
Đọc chữ viết tay
Ở thử nghiệm đầu tiên, CNET sử dụng một đoạn chữ viết tay khá nguệch ngoạc được ghi trên máy đọc sách Boox Note Air 5C. Nội dung là một đoạn trích từ “The Hound of the Baskervilles” của Arthur Conan Doyle.

Kết quả cho thấy Gemini xử lý yêu cầu này tốt hơn rõ rệt. Chatbot của Google có thể đọc chính xác gần như toàn bộ nội dung, thậm chí nhận ra đoạn văn được lấy từ nguồn nào. Gemini còn đưa ra một số nhận xét về đặc điểm nét chữ trong hình ảnh.

Trong khi đó, ChatGPT gặp khó khăn ngay từ những dòng đầu tiên. Nhiều từ bị nhận diện sai và phần phân tích sau đó cũng dựa trên những từ mà chatbot nhận diện không chính xác.
Phân tích thế cờ
Bài kiểm tra tiếp theo khó hơn khi hai chatbot phải “nhìn” vào một thế cờ và tìm nước đi tốt nhất cho bên Đen.

Gemini đưa ra nước đi là Bxf4 sau khi phân tích thế cờ. ChatGPT mất hơn 4 phút để trả lời và cho rằng nước đi c5-d4 là lựa chọn tốt nhất, đồng thời đưa Bxf4 vào phương án thứ hai. Thoạt nhìn, Gemini có vẻ chiếm ưu thế hơn vì đưa ra đáp án nhanh và trùng với phương án thứ hai của ChatGPT.
Để có thêm góc nhìn, CNET đưa cùng hình ảnh, câu lệnh và hai câu trả lời trên cho Claude đánh giá. Kết quả cho thấy Claude cho rằng Gemini đã đọc sai thế cờ, trong khi câu trả lời của ChatGPT phù hợp hơn.
Nhận diện cây cảnh
Với bài kiểm tra thứ ba, hai chatbot được yêu cầu nhận diện một cây Venus flytrap và lý giải nguyên nhân một chiếc bẫy trên cây chuyển sang màu đen. Đây là thử thách tương đối khó vì nhiều giống cây Venus flytrap có ngoại hình gần giống nhau.

Cả ChatGPT lẫn Gemini đều không xác định chính xác được giống cây. Dù vậy, Gemini vẫn đưa ra nhiều nguyên nhân có thể khiến chiếc bẫy chuyển đen, trong đó có nguyên nhân phù hợp với tình trạng thực tế là cây đã cố tiêu hóa một con mồi quá lớn.

ChatGPT cũng đưa ra nguyên nhân tương tự nhưng phần giải thích chi tiết hơn. Chatbot cũng bổ sung thêm thông tin về tình trạng chiếc bẫy và đưa ra một số gợi ý xử lý. Nhờ đó, ChatGPT được đánh giá cao hơn Gemini ở khả năng phân tích hình ảnh và đưa ra thông tin hữu ích từ nội dung được nhận diện.
Xác định nhân vật trong tranh
Ở bài kiểm tra cuối, CNET chụp ba bức tranh mô tả nụ cười của các chị em nhà Sanderson trong “Hocus Pocus” và yêu cầu hai chatbot xác định nội dung hình ảnh.

ChatGPT mô tả khá chính xác những gì xuất hiện trong ảnh nhưng không nhận ra bộ phim. Chatbot phải yêu cầu thêm thông tin để có thể xác định nguồn gốc của tác phẩm.
Gemini thì không mất nhiều thời gian để nhận ra đây là các nhân vật trong “Hocus Pocus” và tiếp tục xác định từng nhân vật cũng như các nữ diễn viên thủ vai họ.

Đây tiếp tục là một bài kiểm tra mà Gemini thể hiện khả năng nhận diện ngữ cảnh tốt hơn. Thay vì chỉ mô tả những gì xuất hiện trước mắt, chatbot còn có thể kết nối hình ảnh với một tác phẩm cụ thể.
Tổng kết
Sau loạt thử nghiệm, cả ChatGPT và Gemini đều có những điểm mạnh riêng. ChatGPT xử lý tốt hơn khi cần phân tích tình trạng của cây cảnh và có phần trả lời chi tiết.
Dù vậy, Gemini lại thể hiện sự ổn định hơn ở khả năng nhận diện hình ảnh. Chatbot không chỉ đọc được đoạn chữ viết tay khó nhìn mà còn nhanh chóng nhận ra nguồn gốc của tranh phim.
Vì vậy, nếu đặt câu hỏi chatbot nào có khả năng “nhìn” và hiểu thế giới xung quanh tốt hơn qua những hình ảnh đời thường, Gemini là cái tên được đánh giá cao hơn trong bài thử nghiệm này. Dù vậy, kết quả vẫn chỉ phản ánh một nhóm tình huống cụ thể chứ không khẳng định chatbot nào sẽ luôn vượt trội trong mọi tác vụ hình ảnh.
Theo CNET










