doc-scraper: Trình thu thập thông tin Go xây dựng ngữ cảnh tài liệu địa phương cho LLMs
doc-scraper, bởi Sriram PR, thu thập tài liệu trang web kỹ thuật và chuẩn bị nó cho các quy trình làm việc hỗ trợ AI. Ứng dụng này thu thập các trang tài liệu và trích xuất nội dung có thể đọc được được tối ưu hóa để sử dụng làm ngữ cảnh mô hình, nhắm đến các nhà phát triển và nhà nghiên cứu AI. Nó nhấn mạnh đầu ra sạch sẽ, có thể tìm kiếm và một kho kiến thức địa phương để các trợ lý dựa trên biên tập viên có thể truy cập tài liệu tham khảo liên quan mà không cần kéo các trang web ồn ào trong quá trình xây dựng lời nhắc.
Chuyển đổi HTML trang web thành Markdown có cấu trúc phù hợp với ngữ cảnh mô hình
Công cụ này là một trình thu thập dữ liệu dựa trên Go, chuyển đổi HTML tài liệu thành Markdown có cấu trúc, loại bỏ thanh điều hướng, chân trang và các phần không phải nội dung khác. Việc chuyển đổi giữ nguyên tiêu đề và mã nội tuyến trong khi giảm thiểu tiếng ồn văn bản, tạo ra các tệp corpus gọn gàng giữ lại ngữ cảnh điều hướng thông qua các tiêu đề và liên kết sạch để dễ dàng truy xuất và tham khảo bởi các quy trình làm việc của mô hình hạ nguồn.
Tìm kiếm và phát hiện thay đổi làm cho corpus đáng tin cậy cho các tác nhân
Ứng dụng nhúng một tìm kiếm ngoại tuyến BM25 được thực hiện thông qua SQLite FTS5, cho phép truy vấn cục bộ chống lại corpus đã thu thập mà không cần truy cập internet. Tính bền vững trạng thái với BadgerDB và SQLite hỗ trợ các hoạt động có thể tiếp tục và một chỉ mục lịch sử. Một cơ chế so sánh nhận thức nội dung xác định các thay đổi trang thực tế thay vì chỉ dựa vào dấu thời gian, điều này giảm tải xuống dư thừa và giữ cho corpus cục bộ tập trung vào các chỉnh sửa có nội dung.
Các mẫu đầu vào và giới hạn thu thập xác định nơi nó thành công
doc-scraper tự động phát hiện các khung tài liệu như Docusaurus, MkDocs, Sphinx, GitBook và ReadTheDocs, và sử dụng một bộ trích xuất dựa trên khả năng đọc trên các trang không quen thuộc. Việc thu thập diễn ra song song với quản lý tài nguyên chia sẻ và giới hạn tốc độ tích hợp sẵn, và trình thu thập dữ liệu tôn trọng robots.txt để giữ lịch sự. Những ranh giới đó ưu tiên việc trích xuất nội dung liên quan đến nhà phát triển trong khi tránh tải mạng quá mức.
Hosting MCP cục bộ phù hợp với quy trình làm việc AI tập trung vào biên tập viên và nhu cầu bảo mật
Khi chạy ở chế độ máy chủ, ứng dụng hoạt động như một máy chủ Giao thức Ngữ cảnh Mô hình để các tác nhân AI cục bộ có thể đọc và tìm kiếm tài liệu bên trong các trình biên tập. Thiết kế cơ sở tri thức cục bộ, ngoại tuyến giữ cho tài liệu có thể tìm kiếm có sẵn cho các tác nhân như Claude Desktop, Claude Code và Cursor, giảm sự phụ thuộc vào việc truy xuất từ xa. Công cụ này được ghi nhận trong các cộng đồng phát triển Go và AI vì đã tạo ra đầu ra sạch trên các trang mà các trình thu thập dữ liệu khác gặp khó khăn.
Phù hợp nhất với các nhà phát triển có kỹ năng kỹ thuật cao có thể xây dựng và lưu trữ ngữ cảnh địa phương
doc-scraper là một lựa chọn thực tế cho các nhà phát triển và nhà nghiên cứu cần tài liệu có thể xác minh, được lưu trữ cục bộ như ngữ cảnh mô hình. Bởi vì công cụ yêu cầu xây dựng từ mã nguồn với Go (phiên bản 1.25 trở lên), nó ưu tiên cho những người dùng có khả năng kỹ thuật; các nhóm không thể biên dịch các dự án Go nên mong đợi có thêm chi phí thiết lập. Người dùng nên kiểm tra các đoạn văn đã được thu thập trước khi sử dụng chúng như là đầu vào mô hình có thẩm quyền.