[TODO-BUZ: xác nhận tư cách "chính thức"]
Biến tài liệu doanh nghiệp thành tri thức AI đáng tin cậy
RAGFlow là engine Retrieval-Augmented Generation (RAG) mã nguồn mở hàng đầu thế giới — kết hợp RAG với khả năng Agent, câu trả lời nào cũng truy vết được tới đúng đoạn tài liệu gốc. BUZ LLC đồng hành triển khai tại Việt Nam — dữ liệu không rời hạ tầng của bạn.
81.000+
GitHub stars
Apache-2.0
giấy phép mã nguồn mở
Trích nguồn
kiểm chứng được đến từng chunk
On-prem / BYOC
dữ liệu không rời hạ tầng
Vấn đề
Doanh nghiệp giàu tài liệu nhưng đói tri thức
Ba rào cản khiến AI chưa thể đi vào quyết định chuyên môn.
Kiến thức phân tán trong hàng nghìn file
Báo cáo, hợp đồng, quy trình, wiki… nằm rải rác qua nhiều phòng ban và định dạng. Nhân viên mất hơn nửa ngày chỉ để tìm một con số cũ.
Chatbot AI bịa câu trả lời
LLM thuần không biết tài liệu nội bộ của bạn, nên trả lời nghe rất tự tin nhưng không kiểm chứng được. Không ai dám dùng nó cho quyết định thật.
Ngại đẩy dữ liệu lên dịch vụ AI nước ngoài
Tài liệu tài chính, pháp lý, khách hàng là tài sản nhạy cảm. Phương án SaaS black-box khiến doanh nghiệp mất quyền kiểm soát dữ liệu.
Năng lực cốt lõi
Vì sao RAGFlow đứng đầu hệ sinh thái RAG mã nguồn mở
9.300+ forks, 470+ contributors — được kiểm chứng bởi cộng đồng toàn cầu.
Deep Document Understanding
Trích xuất tri thức từ tài liệu phức tạp: PDF scan, bảng biểu, ảnh trong PDF/DOCX — với mô hình multimodal. "Quality in, quality out".
Trích nguồn đến từng dòng
Câu trả lời hiển thị kèm chunk gốc và nguồn tham chiếu traceable. Giảm hallucination vì bạn luôn kiểm chứng được mỗi khẳng định.
Hybrid search
Vector + BM25 + custom scoring + fused re-ranking: vừa hiểu ngữ nghĩa, vừa truy vết đúng từ khóa chuyên ngành.
Agent trực quan + MCP
Nền all-in-one kết hợp RAG, tools và MCP trong workflow kéo-thả; code executor Python/JS; có sẵn template.
Kết nối nguồn dữ liệu sẵn có
Word, slide, Excel, ảnh, bản scan, dữ liệu cấu trúc, web page; đồng bộ từ Confluence, S3, Notion, Discord, Google Drive.
Chủ hạ tầng
Mã nguồn mở Apache-2.0 — triển khai on-prem hoặc BYOC. Dữ liệu và chỉ mục ở lại trong hạ tầng do bạn kiểm soát.
Cách hoạt động
Từ đống tài liệu tới câu trả lời có trích nguồn — 4 bước
Nạp tài liệu
Upload hoặc đồng bộ từ Confluence, Notion, S3, Google Drive… Hỗ trợ đa định dạng: Word, slide, Excel, txt, ảnh, bản scan, dữ liệu cấu trúc.
Chặn thông minh & chỉ mục
Chunking theo template — thông minh và giải thích được. Chỉ mục vào Elasticsearch (mặc định) hoặc Infinity hiệu năng cao.
Truy xuất hybrid + nâng cao
Vector + BM25 + re-ranking; tùy chọn GraphRAG (knowledge graph + PageRank) và RAPTOR (tóm tắt phân cấp đa hạt).
Trả lời kèm trích nguồn
Câu trả lời đi kèm nguồn gốc tài liệu; hoặc chạy trong workflow agent (Deep Research, tool-calling), đẩy ra chat đa kênh / API.
Tầng nâng cao
Không chỉ là chat-with-docs
Khi câu hỏi xuyên tài liệu trở nên phức tạp, RAGFlow có sẵn câu trả lời.
GraphRAG
Xây knowledge graph từ thực thể & quan hệ trong tài liệu, kết hợp PageRank để trả lời câu hỏi xuyên tài liệu.
RAPTOR
Tóm tắt phân cấp đa hạt: hỏi chi tiết có chi tiết, hỏi tổng quan có tổng quan — không vỡ trận với kho tài liệu lớn.
Agentic RAG / Deep Research
Tự phân rã câu hỏi phức thành nhiều bước truy xuất, kết hợp tool-calling trước khi tổng hợp câu trả lời.
Chat đa nền tảng
Kết nối bot vào Feishu, Discord, Telegram, Line…; API/SDK trực quan để nhúng vào hệ thống sẵn có.
Triển khai cùng BUZ LLC — đối tác RAGFlow tại Việt Nam
Từ khảo sát dữ liệu tới hệ thống vận hành: đội ngũ tiếng Việt, làm việc giờ Việt, đồng hành dài hạn trên hạ tầng của chính bạn.
- Khảo sát & thiết kế giải pháp RAG/AI
- Triển khai on-prem / BYOC tại Việt Nam
- Tích hợp hệ thống & nguồn dữ liệu sẵn có
- Đào tạo vận hành + hỗ trợ kỹ thuật tiếng Việt