Skip to content
个人学习网站
7 分钟阅读

读 Glean:企业 AI 的护城河不在模型,在权限和上下文

整理公开资料后我的判断是,Glean 值钱的地方不是搜索做得好,而是它把「谁能看什么」这件苦活做完了。也顺手记下我对长上下文淘汰 RAG 这个说法的看法。

我在写一个 Agent 运行时,关心的问题是:Agent 要在企业里真正跑起来,缺的到底是什么。带着这个问题去看 Glean,发现它补的正好是我这一层之上的那块——上下文和权限

这篇是读公开资料后的整理笔记,不是一手调研。数字都来自文末的来源,我没有核实过财务数据,也和 Glean 没有任何往来。把它记下来主要是给自己一份可回查的判断底稿。

它是什么

2019 年成立于帕洛阿尔托,创始人 Arvind Jain 在 Google 做过多年搜索排序和分布式基础设施,之后联合创办了 Rubrik。据资料,他做 Glean 的起点很具体:Rubrik 扩张到一千五百人时,团队最大的效率瓶颈是员工找不到跨部门的知识和人——数据被锁在 Google Drive、Slack、Jira、Confluence、Salesforce 等上百个互不相通的系统里。

产品最初被叫作「工作版 Google」,现在的定位是企业的上下文层与 Agent 编排中枢。

轮次 时间 金额 投后估值 阶段重点
Series C 2022-05 $100M $1.0B 开始规模化商业化
Series D 2024-02 $200M $2.2B 接入生成式 AI,推出 Assistant
Series E 2024-09 $260M $4.6B 研发 Agents,转向自动化工作流
Series F 2025-06 $150M $7.2B Agentic Engine 2 与 Canvas

商业化节奏也快:2025 年 2 月 ARR 破 1 亿美元,之后约 9 个月翻倍到 2 亿。客户里有 Databricks、Duolingo、Instacart、Pinterest、Reddit、三星。

技术上真正难的部分

拆开看,Glean 的架构分五层:连接器接入、知识图谱、权限治理、模型调度、前端应用。其中只有一层是别人短期抄不动的。

连接器:不性感但要熬年头

100 多个零代码连接器,覆盖 Google Workspace、Microsoft 365、Slack、Salesforce、Jira、Confluence、GitHub、Zendesk 等。关键不在数量,在于它们抽取的不只是正文,还有元数据、组织关系和访问控制列表(ACL)。

采集模式是混合的:高频文档和工单走全量索引,保证毫秒级响应;日历、邮箱这类高敏感或高频变动的数据走实时抓取,查询时才调 API。这个折中很务实——纯索引会让敏感数据过度集中,纯联邦搜索又会被 API 限频和延迟拖死。

知识图谱:让「昨天他们在 Slack 提的那个方案」可解

图谱实时映射三类实体:内容(文档、代码、邮件、工单)、人(身份、角色、汇报关系)、行为(编辑记录、点击、停留时长、讨论热度)。检索时并行跑 BM25 词法搜索、向量语义搜索和基于图谱的个性化重排,据称能压在 300 毫秒内,且答案带可逐项追溯的原文链接。

纯向量检索处理不了企业内部的专有名词和缩写,这点我自己踩过——语义相似度会把「我们内部那个叫 X 的东西」泛化到完全无关的文档上。

权限镜像:我认为这才是护城河

Glean 不自建权限体系,而是实时镜像源系统的 ACL 和属性访问控制。检索过滤在索引层就截断,无权限的文档根本不会进入 LLM 的上下文。

为什么这件事关键:很多企业 RAG 方案栽在这里——普通员工用提示词就能套出高管薪酬或未公开财务数据。一旦发生一次,整个项目就死了。

而且这活儿没法用算法绕过去。你得对每个源系统的权限模型逐个建模,还得跟着它们的 API 变更持续维护。这是纯粹的工程苦活,而苦活恰恰是模型厂商最不擅长补的短板。

模型中立

内置 Model Hub 可在 Amazon Bedrock、Google Vertex AI、Azure OpenAI 之间切换,支持自带密钥,集成 15 种以上模型。同时深度支持 MCP,既做服务器也做宿主,可以直接协调外部 Agent 而不用重复抽数据。

商业模式:席位费 + 用量

从纯人头订阅演进成「基础席位 + Enterprise Flex 弹性点数」。搜索和基础问答算在席位里,高级推理和 Agent 调用消耗点数池。

这个设计的意义不在于多收钱,而在于把收入和 Agent 的执行密度绑在一起,而不是和员工人数绑在一起。传统 SaaS 的增长天花板就是客户的人头数,Agent 时代这个假设不成立了。

粘性数据也值得记:企业 SaaS 的 DAU/MAU 通常在 10%–20%,Glean 据称做到约 40%,接近 Slack、Teams 这类核心工作流工具;活跃用户平均每天查 5 次以上。

和 Copilot 打的是什么

Microsoft 365 Copilot 是它竞标时最常遇到的对手,但两者的设计前提不同。

维度 Glean Microsoft 365 Copilot
定位 厂商中立的全域上下文层 深嵌 365 生态的生产力助手
数据广度 100+ 跨厂商 SaaS 平等映射 以 Microsoft Graph 为核心,跨第三方应用质量衰减
权限治理 实时镜像各系统 ACL,另有主动过度共享阻断 依赖 SharePoint/OneDrive 原有权限,历史权限滥用会被放大
Agent 构建 面向业务人员的零代码构建器 偏开发者,需配合 Azure AI Studio、Power Automate
模型 15+ 模型可选,支持自带密钥 绑定 OpenAI / Azure OpenAI
计费 席位 + 弹性点数 约 $30/用户/月的固定加购

Copilot 的优势是装机量和打包价格。但现代中大型企业几乎都是异构栈——Slack 沟通、Jira 跟项目、Salesforce 管客户、Google Workspace 协作同时存在。在这种环境里,中立性不是姿态,是能力边界的差异。

另一个细节:OpenAI 想往 ChatGPT Enterprise 和 Agent 延伸时,Sam Altman 曾提醒投资人避开 Glean。有意思的是他们缺的恰恰不是模型,而是连接器生态和权限管道。

三条我打算记住的判断

一、缺的不是推理能力,是上下文。 过去十年企业软件是各种记录系统——CRM、HR、ERP。大模型出现后,短板从「不会推理」变成「不知道公司内部发生了什么」。谁提供「谁能看什么、事情的前因后果、现在进展如何」,谁就是中枢。

二、长上下文替代不了 RAG,至少在企业里不行。 这个说法我之前也半信过,现在觉得它在企业场景下有三个硬约束:

  • 上下文窗口是全通通道,数据一旦载入,模型没法在推理中自我隔绝未授权信息——权限隔离直接失效
  • 每次交互都带全量数据,Token 成本和首字延迟都不可接受
  • 企业数据不只是静态文本,还有人与人、人与文档的实时交互信号,这些东西根本不在文本里

三、Agent 落地的瓶颈已经从能力变成授权。 现在卡住企业的不是 LLM 能不能做多步推理,而是系统能不能被信任去执行写操作。当 Agent 能发邮件、改 CRM 状态、动代码库时,一次幻觉或越权就是事故。谁掌握了 Agent 的安全治理网关,谁就掌握定价权。

这条对我自己的项目也成立:Agent 运行时做得再稳,如果不能回答「这个动作该不该被允许」,在企业里就是不可用的。

我还没想清楚的

  • 中立性能维持多久。 云厂商和 SaaS 巨头都有动机做防御性收购,一旦被收,中立叙事立刻失效。保持独立冲 IPO 是很强的战略定力要求。
  • Flex 计费会不会反噬毛利。 Agent 转向多步骤自适应执行后,后台模型调用成本会快速上升。用量计费看着是收入弹性,也可能是成本敞口。
  • 微软补短板的速度。 SharePoint 和 Microsoft Graph 的检索质量一直在修。如果 Copilot 降价甚至捆绑免费,预算敏感的中小客户会先动摇。

参考资料

以上事实与数据均来自以下公开来源,判断部分是我自己的: