Grammarly · 技术架构
Grammarly 的技术难点不在网站而在「无处不在的实时推理」。它要在浏览器扩展、Windows 与 macOS 桌面客户端、iOS 与安卓输入法三种完全不同的宿主环境里,把用户正在敲的文本捕获、上传、推理、再把建议以下划线形式回绘到原生控件上,官方称覆盖超过一百万个应用与网站。前端呈现层为服务端渲染,无 JavaScript 环境下正文与内链完整可抓;站点按职能拆成多个子域:应用在 app.grammarly.com、帮助中心走 Zendesk 的 support 子域、静态资源在 contenthub-static.grammarly.com、销售线索在 go.grammarly.com、企业导览在 business-tour.grammarly.com,演示视频托管在 Wistia。安全侧公开的措施包括静态数据 256 位 AES 加密、传输层 SSL/TLS、遵循 GDPR 与 CCPA、企业版提供 BYOK 自带密钥、数据防泄漏、审计日志接口与会话超时。
先说这套架构真正难的地方。绝大多数写作工具只需要做一个网页编辑器,而 Grammarly 选择的是把自己嵌进用户已有的每一个文本框。这意味着它必须为三类宿主环境各写一套注入与回绘方案:浏览器扩展要处理 Chrome、Safari、Firefox、Edge 四种内核下千差万别的富文本编辑器实现,谷歌文档这类自绘画布的编辑器尤其棘手;桌面客户端在 macOS 上依赖辅助功能权限读取活动窗口的文本控件,在 Windows 上则要对接不同的无障碍接口;移动端则以第三方输入法的形式接管键盘。更名博客里 CEO 用了一个很贴切的比喻:他们「在数千个应用里铺设了轨道」,造出一套「把 AI 快速可靠地送到每个应用的公共交通系统」,而过去轨道上只跑 Grammarly 一列车。这套铺轨的工程量,正是后来 Superhuman Go 能把一整队代理直接推送到所有应用里的底层资产,也是竞品短期内最难复制的部分。
推理链路的设计约束是延迟与隐私的双重挤压。用户每敲一个字都可能触发一次分析,要在几十到几百毫秒内返回建议,否则下划线跟不上光标就会显得迟钝。公开资料显示其算法会分析文本、写作行为、使用数据来生成建议,处理在云端完成而非本地,这是它被反复质疑的技术根源——要做云端实时 NLP,就必须把文本传出去。生成式功能上线后链路又多了一层:官方在常见问题里承认,提示类型、提示文本及使用上下文会共享给「少数经过严格审查的服务商」以提供服务,但明确禁止这些大模型服务商用用户内容训练自己的模型。这个表述实际上确认了它并非全栈自研模型,而是自研 NLP 引擎加外部大模型的混合架构,这也解释了为什么在毛利率约八成的情况下,管理层要强调大模型成本对利润的侵蚀。
网站与内容层的架构相对常规但拆分清晰。抓取过程中出现的子域包括:主站承载营销与工具页;app.grammarly.com 是产品应用;account.grammarly.com 管账号与功能定制;support.grammarly.com 是基于 Zendesk 的帮助中心,路径形如 hc/en-us/articles;contenthub-static.grammarly.com 托管博客的 WordPress 静态资源,路径里能看到 blog/wp-content/uploads 的典型特征,说明内容平台走的是 WordPress;go.grammarly.com 承接销售线索表单;experiences.grammarly.com 放客户成功故事;business-tour.grammarly.com 是企业产品交互式导览;redirect.grammarly.com 做统一跳转。产品演示视频统一托管在 Wistia,这是 B 端内容营销的常见选择,好处是能拿到逐秒的观看数据。这种按职能拆子域的做法,让营销页保持轻量与高可抓取性,同时把重交互系统隔离开。
安全与合规是它面向企业销售的硬通货。企业页明确写出静态数据采用 256 位 AES 加密、传输过程使用 SSL/TLS,并声明遵循 GDPR 与 CCPA。信任中心把安全、隐私、合规、负责任 AI 拆成四个专题,称维持年度安全认证、聘请全球公认的第三方渗透测试机构、对整个云与企业基础设施做安全审查;工程博客里有专文记录取得 SOC 2 报告与 ISO 认证的过程,以及从一次性密码迁移到 FIDO2 硬件密钥的实践。企业档独有的技术能力清单相当完整:SAML 单点登录、SCIM 自动化身份供给、功能管理中心、托管模式、邀请与域名捕获、自定义角色、应用与域名管控、客户端控制、机密模式、数据防泄漏、审计日志接口、企业密钥管理 BYOK、会话超时、组级安全控制、成本中心可见性。对跨国团队来说,SCIM 与 SAML 意味着员工入离职能自动同步,这是规模化部署的前提。
扩展性的最新一步是把封闭平台改造成开放平台。Superhuman Agents SDK 允许企业把自研代理挂进 Go,例如内部训练过公司数据的聊天机器人可以直接在任意应用里被调用;代理商店里已经上架 Common Room、Radical Candor、Latimer、Fireflies、Parallel、Speechify、Quizlet,Saifr、Axios HQ、Napkin AI 在路上。这一步的战略含义是:Grammarly 十几年积累的「注入层」从自用资产变成了可对外收租的基础设施,这是它对抗大模型厂商降维打击的最实际的一张牌——大模型可以做得比它更聪明,但短期内做不到在一百万个应用的原生文本框里贴着光标出建议。
对出海卖家而言,真正需要关心的是三件工程事实。第一是权限代价:macOS 客户端需要辅助功能权限,浏览器扩展需要「读取和更改你在所有网站上的数据」权限,这意味着装上它之后,公司邮箱、供应链系统、店铺后台的文本都可能经过其云端。如果团队处理供应商报价、客户身份信息或未公开的选品计划,这个风险必须提前评估。第二是可控开关:官方在桌面端页与信任中心都强调可以在任意应用或站点里单独关闭,务实做法是只在邮件与社媒后台开启、在 ERP 与财务系统里关闭。第三是数据训练开关:账号设置里有「产品改进与训练」选项可以关闭,「定制化辅助」也可随时退出并删除已存数据,这两个开关应该在团队部署时就统一设置好,而不是等到出了数据事故才回头补救,因为已经上传的文本无法追回。