
Anthropic chia bot thu thập dữ liệu web thành ba
Anthropic, công ty phát triển Claude AI, vừa công bố danh sách 3 bot thu thập dữ liệu web với mục đích riêng biệt.
Anthropic vừa cập nhật tài liệu thu thập dữ liệu web và công bố danh sách 3 bot thu thập dữ liệu web với mục đích riêng biệt: ClaudeBot (thu thập dữ liệu huấn luyện), Claude-SearchBot (lập chỉ mục nội dung cho kết quả tìm kiếm) và Claude-User (truy xuất trang khi người dùng đặt câu hỏi trực tiếp cho Claude).
Tài liệu giới thiệu bot thu thập dữ liệu của Anthropic cũng kèm cảnh báo rõ ràng về hậu quả khi bị chặn. Theo Anthropic, nếu chặn Claude-SearchBot, nội dung trang web “có thể giảm khả năng hiển thị trong kết quả tìm kiếm của người dùng”. Tương tự, chặn Claude-User cũng “có thể làm giảm mức độ hiện diện khi người dùng tìm kiếm trực tiếp”.
ClaudeBot
ClaudeBot helps enhance the utility and safety of our generative AI models by collecting web content that could potentially contribute to their training.
When a site restricts ClaudeBot access, it signals that the site’s future materials should be excluded from our AI model training datasets.
Claude-User
Claude-User supports Claude AI users. When individuals ask questions to Claude, it may access websites using a Claude-User agent.
Claude-User allows site owners to control which sites can be accessed through these user-initiated requests. Disabling Claude-User on your site prevents our system from retrieving your content in response to a user query, which may reduce your site’s visibility for user-directed web search.
Claude-SearchBot
Claude-SearchBot navigates the web to improve search result quality for users. It analyzes online content specifically to enhance the relevance and accuracy of search responses.
Disabling Claude-SearchBot on your site prevents our system from indexing your content for search optimization, which may reduce your site’s visibility and accuracy in user search results.
Việc Anthropic chia bot thu thập dữ liệu web thành 3 bot riêng cho thấy xu hướng chung trong ngành. Cuối năm 2024, OpenAI, công ty phát triển ChatGPT, đã công bố cấu trúc thu thập dữ liệu với ba tầng, gồm GPTBot, OAI-SearchBot và ChatGPT-User. Perplexity cũng vận hành theo mô hình tương tự nhưng chỉ có hai tầng với PerplexityBot và Perplexity-User.
Đáng chú ý, Anthropic tuyên bố cả 3 bot đều tuân thủ robots.txt, trong khi OpenAI và Perplexity cảnh báo rằng các bot truy xuất theo yêu cầu người dùng có thể không bị ràng buộc bởi quy tắc này.
Một nghiên cứu của BuzzStream ghi nhận 79% trang tin tức hàng đầu chặn ít nhất một bot huấn luyện AI, nhưng 71% cũng vô tình chặn luôn bot tìm kiếm, đồng nghĩa với việc tự loại mình khỏi các trích dẫn trong kết quả tìm kiếm bằng AI. Phân tích từ Hostinger trên 66,7 tỉ yêu cầu bot cho thấy bot tìm kiếm của OpenAI đã tăng độ phủ từ 4,7% lên hơn 55% số trang web, trong khi bot huấn luyện giảm từ 84% xuống còn 12%.
Khi tìm kiếm bằng AI ngày càng chiếm nhiều lưu lượng truy cập giới thiệu, quyết định chặn hay cho phép từng loại bot sẽ ảnh hưởng trực tiếp đến khả năng hiển thị của nội dung trên các nền tảng AI.
Thêm hanthienhai.com vào danh sách nguồn ưu tiên trên Google