WeKnora
腾讯开源的企业级 LLM 知识平台,把文档解析、向量化、RAG 检索和 ReAct Agent 串成完整流水线,并能让 agent 自动把原始文档蒸馏成可互相链接、带知识图谱和版本回滚的 Markdown Wiki。亮点在模块化:20+ LLM provider、8 种向量库、多种对象存储和 IM 渠道都能替换,自带多工作区 RBAC、Langfuse 观测、任务队列看板与 Skill 沙箱,适合私有化部署做企业内部知识问答。数据源覆盖飞书/Notion/语雀/GitLab 等,MIT 协议。
README
| English | 简体中文 | 日本語 | 한국어 |
概览 • 架构 • 核心特性 • 快速开始 • API 参考 • 开发者指南
💡 WeKnora —— 用 RAG、Agent 与 Auto-Wiki 让文档成为活跃的知识
📌 概览
WeKnora 是一个开源、由 LLM 驱动的知识框架,专为企业级文档理解、语义检索与自主推理而构建。
https://github.com/user-attachments/assets/19b28ce2-a62f-4f54-b289-c983576259bc
2 分 25 秒 · 1080p · 英文旁白与字幕。
它围绕三大核心能力组织:面向日常查询的 基于 RAG 的快速问答;一个 ReAct Agent,可自主编排检索、MCP 工具、租户技能目录、会话持久的 Docker / E2B / Cube 沙箱以及 Web 搜索,以处理复杂的多步任务;以及全新的 Wiki 模式,其中 Agent 将原始文档提炼为一个可自我维护、相互链接的 markdown 知识库,并配有交互式知识图谱,同时支持手动编辑、版本历史与一键回滚。跨会话长期记忆会记住你是谁,以及你反复询问的内容。知识治理同样得心应手:树状文件夹视图保留上传文件的目录结构,而支持版本历史的分块编辑让检索分块可以像文档一样被编辑、比对差异与还原。结合多源导入(飞书知识库 / 飞书云盘 / GitLab / 腾讯 IMA / Notion / 语雀 / 钉钉文档 / RSS,且仍在增加)、用于将 Agent 发布到外部站点的网站嵌入组件、面向程序化集成的带 principal 模型的作用域 API Key、每个工作区可用的多实例存储后端以实现灵活的数据放置、20+ LLM 提供商集成(包括 LiteLLM)、完整的 Langfuse 可观测性外加一个带 worker 池治理的运行时任务队列看板、企业级多工作区 RBAC(4 级角色矩阵 + 按资源所有权 + 按工作区审计日志),以及完全可自托管的模块化架构,WeKnora 将零散文档变为可查询、可推理、持续演进的知识资产。
该框架支持从飞书、GitLab、腾讯 IMA、Notion 和语雀自动同步知识(更多数据源即将到来),可处理包括 PDF、Word、图片、Excel 和 XMind 在内的 10+ 种文档格式,并能通过企业微信、飞书、Slack 和 Telegram 等 IM 渠道直接提供问答服务。它兼容主流 LLM 提供商,包括 OpenAI、DeepSeek、通义千问(阿里云)、智谱、混元、Gemini、MiniMax、NVIDIA、LiteLLM 和 Ollama。Office 文件可通过 anydoc 在进程内解析。其完全模块化的设计允许替换 LLM、向量数据库和存储后端,并支持本地与私有云部署,确保完整的数据主权。WeKnora 还集成了 Langfuse,可对 Agent 推理、token 用量和 pipeline 链路进行全面可观测。
✨ 最新更新
- v0.8.0 —— 技能沙箱运行时(会话持久的 Docker / E2B / Cube 后端,支持按租户的网络策略;移除 Local 宿主进程后端;Docker 需主动开启);租户技能目录(从 ClawHub / SkillHub / git / zip 安装,按沙箱快照,实时进度,文件浏览/编辑,个人与工作区环境变量);跨会话长期记忆(profile / preference / fact / task / interest,自动抽取并需确认,
search_memory);进程内 anydoc office 解析器;官方 DeepSeek Harness 插件@wxg-prc-cpg/dsh-weknora;GitLab 与腾讯 IMA 数据源;LiteLLM;Exa 与 Metaso Web 搜索;XMind 解析;聊天产物(artifacts)、问题大纲与时间戳;上下文压缩与提供商 prompt-cache 标记。此外还有 OIDC JWKS 校验、可选的复杂密码、文档自动打标签,以及广泛的沙箱/安全加固。详见CHANGELOG.md。 - v0.7.2 —— 上线官方产品文档站点(VitePress;六大板块、约 50 页,覆盖约 360 个 API 端点与约 150 个环境变量,支持独立 Docker/Nginx 部署、快速开始示例数据与本地 MCP 演示);知识库文件夹树(上传路径作为一等数据存储,像文件管理器一样浏览/重命名/重新归档文档);支持版本历史的分块编辑(在 UI 中编辑检索分块,支持逐版本差异与回滚、自动重建索引,以及自定义文档元数据);Wiki 页面版本历史(快照 + 行级 diff + 一键回滚 + 浏览器内手动编辑);可直接加载的文件 URL 通过
resource_urls=public/RESOURCE_URL_MODE(第三方应用无需再发起一次带鉴权的代理调用来渲染图片和文件);飞书云盘数据源以及通过 blocks API 同步 docx;批量文档打标签;MCP Server 1.1.x(迁移至 mcp 2.x 高阶 API,官方 PyPI 包tencent-weknora-mcp,新增create_knowledge_from_text与list_shared_knowledge_bases,工具总数达 29 个);AWS S3 默认凭证链(IAM Role / IRSA);本地 HTML 上传解析;QQBot markdown 回复;面向 app / frontend / docreader / mcp-server 的新增 PR CI 检查。此外还有大规模的 router 与modelcontext重构、rerank 与分块质量优化,以及大量稳定性修复。详见CHANGELOG.md。 - v0.7.1 —— 新增 云之家 IM 集成(WebSocket + 图片消息 + markdown 回复);火山引擎 rerank 提供商(支持请求批处理)与 智谱 AI Web 搜索提供商;面向控制面自动化的平台级作用域 API Key(租户管理、系统设置、运行时队列、审计日志);按知识库的活动审计轨迹;FAQ 管理增强(筛选、打标签、导出、导入追踪);Langfuse OTLP/OTel 链路追踪迁移,支持 W3C traceparent 传播;聊天头部操作支持一键导出 Markdown,引用抽屉中展示 wiki 工具结果;prompt-cache 可观测性;会话渠道治理(管理员限定 IM/embed/API 会话);更健壮的飞书大型知识库同步;移除遗留的 Neo4j 对话记忆依赖。此外还有广泛的 slug 完整性、SSRF 传输与状态同步加固。详见
CHANGELOG.md。 - v0.7.0 —— 细粒度作用域 API Key 与 principal 模型(能力级授权 + 按知识库限制 + API 集成调试台);运行时任务队列可观测看板与 worker 池治理(按阶段的池 + 按模型的并发限流器 + 失败任务查看/重试);多实例存储后端(每个工作区多个存储实例,按知识库绑定,支持默认实例);会话级临时附件(异步图片/文档解析 + 组合限制);问题与追问建议;稳定的资源注册表,支持 LLM 上下文别名压缩;
@Skill / @MCP提及与作用域化的 Agent 运行时;会话中途 MCP OAuth;QQBot 与 Lark(飞书国际版)IM 集成;Redis TLS;Requesty 模型提供商 + Keenable Web 搜索;无租户开通与受控的自助工作区;管理员密码重置;知识库复制流程;weknoraCLI v0.10。此外还有广泛的安全加固(SSRF、密钥脱敏、SQL 校验、IDOR)。详见CHANGELOG.md。 - v0.6.3 —— 网站嵌入组件与集成中心(安全模式 token 换取 + 速率限制);聊天体验大改(引用浮层、RAG pipeline 进度、流式 markdown);文档多标签与批量重新解析;Wiki 文件夹与层级导航;RSS 数据源;MCP OAuth2;EPUB / MHTML 解析;Agent 模型就绪检查;模型测试调试器;会话来源筛选;工作区删除 UI。详见
CHANGELOG.md。 - v0.6.2 —— 按上传批次配置处理流程,并带上传确认对话框;使用
process_config重新解析文档;weknoraCLI v0.9(内置 Agent Skills、session stop、认证/配置档案统一);知识库跑马灯多选;针对 1024 维 pgvector embedding 的 HNSW 索引;聊天资源 store 重构;仅保留 Langfuse 链路追踪(移除 Jaeger)。详见CHANGELOG.md。 - v0.6.1 —— 文档解析链路追踪时间轴(Langfuse 风格 span 树,带逐阶段进度 + 停止解析);OpenSearch 向量存储驱动;通过 YAML 声明式内置模型;系统管理员与统一平台设置 + 审计日志;新用户引导;设置 UI 重新设计;
weknoraCLI v0.7 / v0.8(agent 优先的通信契约、NDJSON、--dry-run);OpenDataLoader + PaddleOCR-VL 解析器;MCP server 多传输(stdio / SSE / HTTP);按模型的思考模式配置;腾讯 LKEAP rerank + 原生 Gemini embedding + MiniMax-M3。详见CHANGELOG.md。 - v0.6.0 —— 工作区 RBAC(4 级角色矩阵
Owner/Admin/Contributor/Viewer+ 按知识库所有权 + 按工作区审计日志)、工作区成员管理与多工作区 UX、自助工作区;weknoraCLI v0.4 GA,含mcp serve;跨向量存储的知识库检索扇出;AES-256-GCM 凭证加密 + docreader gRPC TLS + Token;智谱 embedder + 华为 OBS;服务端用户偏好;Go 1.26.0。详见docs/RBAC说明.md与CHANGELOG.md。 - v0.5.2 —— Wiki 导入可扩展至 4 万篇文档的知识库(任务队列 + DLQ);MCP 人工介入工具审批;Anthropic / Apache Doris / 腾讯 VectorDB / KS3 / SearXNG 后端;带实时预览的自适应三级分块;全局 ⌘K 命令面板;语雀连接器 + 微信小程序;
weknoraCLI 预览版。 - v0.5.1 —— 知识库批量管理;工作区级 IM 渠道总览;会话搜索 + 用户级置顶;统一的模型 / Web 搜索 / MCP 设置卡片;按 Agent 的 LLM 超时;桌面端工作区切换。
- v0.5.0 —— Wiki 模式 GA —— Agent 自动生成结构化、相互链接的 Markdown wiki 页面,并配有知识图谱;UI 中提供 wiki 浏览器与可视化图谱。
- v0.4.0 —— WeKnora Cloud(托管 LLM + 解析);Chrome 扩展;ClawHub Skill;微信 IM;附件处理;Azure OpenAI / 阿里云 OSS;Notion 连接器;百度 + Ollama Web 搜索;VectorStore 管理。
- v0.3.6 —— ASR(音频);飞书数据源自动同步;OIDC;IM 引用回复上下文 + 基于话题的会话;文档摘要;Tavily 搜索;并行工具调用;Agent @mention 范围限制。
- v0.3.5 —— Telegram / 钉钉 / Mattermost IM;IM 斜杠命令 + 问答队列;推荐问题;VLM 自动描述 MCP 工具图片;Novita AI;渠道追踪。
- v0.3.4 —— 企业微信 / 飞书 / Slack IM;多模态图片支持;NVIDIA 模型 API;Weaviate;AWS S3;AES-256-GCM API Key 加密;内置 MCP 服务;混合检索优化;
final_answer工具。 - v0.3.3 —— 父子分块;知识库置顶;兜底回复;rerank 前的段落清洗;存储自动创建;Milvus。
- v0.3.2 —— 知识搜索入口;按来源的解析器与存储引擎配置;本地存储中的图片渲染;文档预览;火山引擎 TOS;Mermaid 渲染;批量会话管理;记忆图谱预览。
- v0.3.0 —— 共享空间;Agent Skills + 沙箱化执行;自定义 Agent;数据分析 Agent;思考模式;Bing / Google Web 搜索;API Key 鉴权;Helm chart;韩语 i18n;Qdrant。
- v0.2.0 —— Agent 模式(ReACT);多类型知识库(FAQ + 文档);对话策略配置;DuckDuckGo Web 搜索;MCP 工具集成;支持 Agent 模式切换的新 UI;MQ 异步任务管理。
📱 界面展示
🛠️ 技能沙箱对话 · 生成并预览 Word 文件![]() |
|
📦 技能目录 · 安装到 E2B 沙箱![]() |
🤖 Agent 模式 · 搜索、读取技能、写入沙箱文件![]() |
💬 智能问答对话![]() |
|
📖 Wiki 浏览器![]() |
🕸️ Wiki 知识图谱![]() |
🕘 Wiki 页面版本历史与回滚![]() |
✂️ 分块编辑与版本历史![]() |
📁 文件夹树与批量操作![]() |
🔭 可观测性 · Langfuse 链路追踪![]() |
🏗️ 架构

从文档解析、向量化、检索到 LLM 推理的完全模块化 pipeline —— 每个组件都可替换、可扩展。支持本地/私有云部署,具备完整数据主权,并提供零门槛的 Web UI 以便快速上手。
🧩 功能总览
智能对话
| 能力 | 说明 |
|---|---|
| 智能推理 | ReACT 渐进式多步推理,自主编排知识检索、MCP 工具、技能沙箱与 Web 搜索 |
| 快速问答 | 基于 RAG 的知识库问答,快速且准确地给出答案 |
| Wiki 模式 | Agent 驱动的自动生成:从原始文档生成结构化、相互链接的 markdown Wiki 页面;支持浏览器内手动编辑、页面版本历史、行级 diff 与一键回滚 |
| 技能目录与沙箱 | 工作区技能目录(ClawHub / SkillHub / git / zip)可安装到会话持久的 Docker / E2B / Cube 沙箱;shell_exec、文件工具、artifacts、按配置的网络策略;已移除 Local 宿主进程后端 |
| 长期记忆 | 跨会话记忆(profile / preference / fact / task / interest),支持自动抽取、用户确认与按需 search_memory |
| 工具调用 | 内置工具、MCP 工具(含 OAuth2 远程服务、会话中途 OAuth)、Web 搜索;通过 @Skill / @MCP 提及按轮次限定 Agent 运行时范围 |
| 对话策略 | 在线 Prompt 编辑、检索阈值调优、多轮上下文感知、按 Agent 的引用输出开关 |
| 推荐问题 | 基于知识库内容自动生成问题建议与回答后追问 |
| 临时附件 | 会话级图片/文档上传,异步解析以支持一次性问答,并有图片 + 附件组合上限 |
| 引用与 RAG 进度 | 行内引用浮层与引用抽屉(区分 Web / 知识库来源)、共享 markdown 渲染,以及聊天中逐阶段的 RAG pipeline 进度 |
| 会话管理 | 侧边栏会话按来源(Web / IM / Embed)筛选与分组,支持行内会话标题重命名 |
知识管理
| 能力 | 说明 |
|---|---|
| 知识库类型 | FAQ / 文档 / Wiki,支持文件夹导入、URL 导入、多标签管理与在线录入 |
| 文件夹树 | 文件夹上传保留原始目录结构,侧边栏树支持浏览、文件夹重命名,以及将文档重新归档到其他文件夹 |
| 分块编辑与版本 | 直接在 UI 中编辑检索分块,支持逐版本快照、diff 与一键回滚,编辑后自动重建索引;生成的问题可新增、编辑、删除与重新生成;支持自定义文档元数据 |
| 按上传批次的处理配置 | 通过上传确认对话框或 process_config API,按上传批次覆盖解析器、分块、多模态(VLM / ASR)、图谱抽取与问题生成配置;可用新设置重新解析 |
| 批量重新解析 | 一次为多篇文档重新排队解析,可选按批次指定 process_config |
| 数据源导入 | 从飞书知识库 / 飞书云盘 / Lark / GitLab / 腾讯 IMA / Notion / 语雀 / 钉钉文档 / RSS 源自动同步(更多数据源即将到来);支持增量与全量同步 |
| 文档格式 | PDF / Word / Txt / Markdown / HTML / EPUB / MHTML / 图片 / CSV / Excel / PPT / JSON / XMind |
| 自动打标签 | 解析完成后,从知识库已有标签集合中挑选匹配标签,不新建标签,也不覆盖人工标签 |
| 检索策略 | BM25 稀疏 / 稠密检索 / GraphRAG / 父子分块 / HNSW 加速的 pgvector(1024 维)/ 多维索引 |
| 批量选择与打标签 | 在知识库列表中框选多篇文档,进行批量重新解析与批量打标签(常用标签预先勾选) |
| 端到端测试 | 全链路可视化,包含召回命中率、BLEU / ROUGE 指标评估 |
集成与扩展
| 能力 | 说明 |
|---|---|
| LLM | OpenAI / Azure OpenAI / Anthropic (Claude) / DeepSeek / 通义千问(阿里云)/ 智谱 / 混元 / 豆包(火山引擎)/ Gemini / MiniMax / NVIDIA / Novita AI / SiliconFlow / OpenRouter / Requesty / LiteLLM / Ollama |
| Embedding | Ollama / BGE / GTE / 智谱 / OpenAI 兼容 API |
| 向量数据库 | PostgreSQL (pgvector) / Elasticsearch / OpenSearch / Milvus / Weaviate / Qdrant / Apache Doris / 腾讯 VectorDB |
| 对象存储 | 本地 / MinIO / AWS S3(IAM Role / IRSA 默认凭证链)/ 火山引擎 TOS / 阿里云 OSS / 金山云 KS3 / 华为云 OBS;每个工作区支持多个存储实例,可按知识库绑定并设置默认实例 |
| IM 渠道 | 企业微信 / 飞书 / Lark(飞书国际版)/ QQBot / Slack / Telegram / 钉钉 / Mattermost / 微信 / 云之家 |
| 网站嵌入 | 通过嵌入组件发布 Agent,支持域名白名单、速率限制与安全模式 token 换取 |
| Web 搜索 | DuckDuckGo / Bing / Google / Tavily / 百度 / Ollama / SearXNG / Keenable / 智谱 AI / Exa / Metaso |
| API 集成 | 作用域 API Key(能力级授权 + 按知识库限制 + 带限流的最近使用时间追踪),并提供 API 集成调试台;MCP OAuth 与 embed 会话按 principal 隔离;resource_urls=public 返回可直接加载的文件/图片 URL,省去第二次带鉴权的代理调用 |
| MCP Server | 官方 PyPI 包 tencent-weknora-mcp,通过 stdio / SSE / HTTP 传输提供 29 个工具 |
平台
| 能力 | 说明 |
|---|---|
| 部署 | 本地 / Docker / Kubernetes(Helm),支持私有化与离线环境 |
| UI | Web UI / RESTful API / CLI(weknora)/ Chrome 扩展 / 网站嵌入组件 / 微信小程序 |
| 访问控制 | 工作区 RBAC,4 级角色矩阵(Owner / Admin / Contributor / Viewer)、按知识库的资源所有权、按工作区审计日志、仅邀请制工作区、无租户开通与受控的自助工作区创建、管理员密码重置(吊销会话)、跨工作区超级管理员、作用域 API Key |
| 安全 | API Key 与 MCP / 数据源凭证静态加密(AES-256-GCM),支持平滑密钥轮换;app 与 docreader 之间启用 gRPC TLS + Token;Redis TLS;SSRF 安全 HTTP 客户端(数据源、URL 导入、重定向链);响应中的密钥脱敏;技能沙箱隔离(Docker 需主动开启 / E2B / Cube),可按配置设置网络策略;OIDC ID-token JWKS 校验;可选的复杂密码策略 |
| 可观测性 | 集成 Langfuse(唯一链路追踪后端),用于 ReAct 循环、token 追踪、工具调用与 pipeline 链路追踪;内置 Langfuse 风格的文档解析链路追踪时间轴,带逐阶段进度;系统管理员的运行时任务队列看板(队列深度、按模型并发、失败任务查看与手动重试) |
| 任务管理 | MQ 异步任务,支持按阶段的 worker 池治理(core / post-process / enrichment / maintenance + 弹性共享池,外加独立的 Wiki 池)与按模型的后台并发限流器;版本升级时自动进行数据库迁移 |
| 模型管理 | 集中配置,通过 YAML 声明式内置模型,按知识库选择模型,按模型的思考模式与 embedding 维度覆盖,交互式模型测试调试器,多工作区内置模型共享,WeKnora Cloud 托管模型与解析 |
🧩 Chrome 扩展
WeKnora Chrome 扩展 让你可以直接把网页内容采集到 WeKnora 知识库。在浏览器中选中文字、图片或整个页面,一键保存为知识条目 —— 无需复制粘贴或上传文件。
📱 微信小程序
WeKnora 小程序 提供了一个轻量级移动客户端,用于在微信中配置 WeKnora API 访问、选择知识库、导入 URL 并进行知识问答。
🦞 ClawHub Skill
WeKnora ClawHub Skill 是发布在 ClawHub 平台上的 WeKnora 技能。安装后,它支持文档导入(文件 / URL / Markdown)、跨知识库的混合搜索(向量 + 关键词),以及知识条目管理 —— 全部通过 WeKnora REST API 完成。
- 文档导入 —— 通过 Agent 上传文件、导入网页或写入 Markdown 知识
- 混合搜索 —— 在单个或跨知识库中使用向量 + 关键词检索
- 知识管理 —— 以编程方式列出、浏览、编辑和删除知识条目
🐋 DeepSeek Harness 插件
@wxg-prc-cpg/dsh-weknora 是官方 DeepSeek Harness(dsh)插件(文档)。该 harness 自身不具备检索、embedding 或知识库能力,因此该插件为编码 Agent 提供了你的文档:执行 dsh plugin --profile web add @wxg-prc-cpg/dsh-weknora,指向一个部署实例,Agent 的工具集里就会出现四个只读工具。
weknora_search—— 混合检索,逐字返回来源段落,每段带有可复用的knowledge_idweknora_read_document—— 按顺序重新拼装单篇文档的段落,支持分页weknora_ask—— WeKnora 自身基于 RAG 或 ReAct pipeline 生成的带引用综合答案weknora_list_knowledge_bases—— 知识库名称与 id,便于 Agent 限定自己的搜索范围
⌨️ 命令行界面
weknora 是官方 CLI,用于在终端或 AI Agent 中调用 API。它以 agent 优先:每个命令默认输出稳定的 JSON 信封(带映射到退出码的类型化错误码),而 --format text 则渲染为便于人阅读的格式。它还提供精选的 MCP 工具面(weknora mcp serve),并内置 Agent Skills。
weknora profile add prod --host https://kb.example.com --use
weknora auth login
weknora kb list
weknora link --kb my-knowledge-base # bind the current directory
weknora doc upload notes.md
weknora chat "summarise the design doc"
用于无头 / CI 场景时,设置 WEKNORA_API_KEY + WEKNORA_HOST 即可完全跳过 auth login —— 不会向磁盘写入任何凭证。
安装方式与 5 分钟快速上手见 cli/README.md,AI Agent 所依赖的操作契约见 cli/AGENTS.md。
🚀 快速开始
🛠 前置条件
📦 安装与启动
git clone https://github.com/Tencent/WeKnora.git
cd WeKnora
cp .env.example .env # Edit .env as needed, see comments in the file
docker compose pull # Pull the latest images
docker compose up -d # Start core services
启动完成后,访问 http://localhost 即可开始使用。
若想使用本地 Ollama 模型,请先运行
ollama serve > /dev/null 2>&1 &。
🔄 升级
如果你已经在运行 WeKnora,并下载了更新的版本:
# Set WEKNORA_VERSION in









