# Helio 想让 AI 当你同事，这事现在能成功吗？

> 龙虾AGI通用实验室 · 2026-05-28

![](images/0cc686/img_001.png)

最近看到一篇关于 Helio 的文章，它提出的产品理念让我停下来想了很久——不是做给人用的 AI 工具，而是做像人的 AI 同事。

这个事情我本来也想做类似的，所以格外感兴趣。不是想看它功能多炫，而是想看看它是不是找到了什么我没想到的方法，或者踩到了什么我也会踩的坑。于是我做了一轮调研，也和 Claude 做了一轮深度对话。

先说清楚：**我没有用过 Helio，这篇文章不是产品测评。** 我讨论的是它的设计理念和背后的思路，以及沿着"AI 从工具变成同事"这个命题深入追问后，发现的几个行业级别的根本问题。Helio 是引子，思考是主体。

· · ·

## 一、Helio 在尝试做什么

Helio（helio.im）管自己叫 AI Native Workforce。从官网的产品描述来看，它做的事情用一句话概括就是：**把 AI 直接放进 IM 里，让 AI 成为和人类并排的团队成员。**

不是给 Slack 加个 AI 侧边栏，不是做一个独立的 agent 编排工具。它从头设计了一套协作环境，频道、任务、邮件、编码会话、会议——所有模块里，AI 和人类走的是同一套消息路由和权限模型。

介绍文章里有个细节让我印象深刻：Helio 里面没有 New Chat 按钮。AI 不需要被"打开"，它一直在频道里。你 @ 它，它做事；你不 @ 它，它按自己的日程继续推进。你下班了，它还在干。第二天打开频道，看到的不是空白界面，是它跑了一晚上的结果。

这个设计意图和我们用 Claude Code、OpenClaw 的体验确实不一样。那些工具很强，但使用它们的前提是你得先把配置写好——CLAUDE.md、SOUL.md、AGENTS.md、action 定义、trigger 调试。能力不是问题，从"我有个想法"到 AI 真正开始干活之间隔着一堆配置工作。Helio 想做的是把这层配置彻底抹掉：建个频道，把 AI 同事拉进来，自然语言说清楚谁干什么就行。

· · ·

## 二、从"工具"到"同事"：它在设计上思考了哪几层？

做调研的时候，我试图从 Helio 官网有限的信息里拼出它的设计框架。从公开信息来看，它至少在五个层面上做了区别于传统 AI 工具的设计。

**身份层：AI 是系统里的一等公民。** 从官网描述来看，AI 用户在成员列表里和人类没有视觉区分，有真实的邮箱地址（你的域名@helio.im），走和人类完全一样的频道和私信成员关系，没有隐藏的影子访问权限。编码环境里每个 AI 有自己的 dotfiles 和工具配置，跨会话持久化。权限管理用了 OpenFGA（Auth0 的细粒度权限引擎），说明对 AI 的权限控制不是粗粒度的"能用/不能用"，而是可以精确到频道、文件、操作级别。

**自主层：AI 不等你喊才动。** AI 同事可以自己拿任务、开会话、推进工作。任务系统有原子级认领机制，防止两个 AI 抢同一张票。这在多 agent 环境里是一个很实际的工程问题。

**上下文层：频道就是天然的上下文隔离。** 这是 IM 架构的一个核心收益。#backend-v2 的 AI 不需要看 #marketing 的讨论，就像一个后端工程师不会坐在市场部的会议里。频道机制把上下文切成了互不干扰的切片，比"一个大聊天框什么都往里倒"的传统模式要聪明。

**记忆层：Dream 机制。** 从官网描述来看，每个 AI 同事有一个持久化的 ~/.brain/ 目录存储角色记忆。产品还提出了一个叫 Dream 的机制——每天凌晨 AI 回顾当天接触的频道和任务，把有效经验写入 ~/.brain/soul.md，改动写入 changelog 可审阅可回滚。本质上就是让 AI "睡前整理笔记"，第二天带着优化后的认知回来。

**问责层：谁做了什么，必须清楚。** 每条消息有清晰的作者归属，高风险操作（发外部邮件、部署、以你名义发消息）路由到人类审批。一个很精妙的细节是：关闭任务是人类专属操作。AI 可以做完工作提交，但"签字画押"只有人类能按。

这五层设计作为一个框架，确实比"给 Slack 加个 AI 侧边栏"想得远。

**但必须诚实地说，Helio 目前公开的技术细节非常有限。** 没有技术博客、没有 API 文档、没有公开的架构说明。上面这些分析是从官网产品页的只言片语和隐私政策里拼出来的。这些设计到底实现到什么程度、实际跑起来效果如何，单从公开信息判断不了。Dream 机制、会议 AI 等功能在官网标注为"Coming soon"，意味着产品愿景和交付之间还有距离。公司主体是 Lifecycle AI, LLC，注册在特拉华州，团队和融资信息未公开——对公测阶段的初创公司来说正常，但确实意味着我们对它的评估是有限的。

**接下来的讨论，不是在评价 Helio 做得好不好，而是沿着它提出的这个命题——"AI 从工具变成同事"——追问几个更深的问题。**

· · ·

## 三、第一个深水区：AI 自主工作了，谁来防止它跑偏？

Helio 的设计框架回答了"怎么让 AI 看起来像同事"，但还有一个更本质的问题：**同事之所以是同事，不只是因为他坐在你旁边的工位上，而是因为他知道什么时候该自己做决定、什么时候该来问你。**

这个能力，目前的大模型不稳定具备。

以 Helio 介绍文章里那个四人内容流水线为例：调研员扫 AI 领域 24 小时动态，文案挑一条写推文，编辑改结构，SEO 加 hashtag。四个 AI 自动接力，没有人工干预。文章说效果很好。

但换个角度想：**如果调研员第一步就选错了方向呢？** 它扫出五条新闻，选了五眼联盟那条而不是 Google I/O 预告。后面三个 AI 基于这个选择继续工作——文案认真写了推文，编辑认真改了结构，SEO 认真加了 hashtag。每一步看起来都很专业。但如果第一步方向就不对，后面三步的工作全白做了。

更隐蔽的问题是：**每一步 AI 都会在自己的环节里加入新的判断和细节，让错误变得越来越"精致"、越来越难发现。** 最终你看到的成品，语言流畅、结构合理、hashtag 精准——完全看不出任何问题，直到你发现这条推文发出去没人在意，因为你的受众根本不关心五眼联盟的安全指引。

从 Helio 目前公开的设计来看，它有几层约束：操作级别的门禁（高风险操作需要审批）、权限分级（Trust/Always/Onetime 三级）、以及频道的公开性（所有工作过程可见）。这些约束能防"AI 干坏事"——比如未经授权发了一封外部邮件。但防不了"AI 沿着错误方向做看起来正确的事"——因为选新闻这个动作本身不触发任何审批门禁，它不是高风险操作，但它是高影响决策。

**这是所有自主 agent 系统的核心困境：自主性和准确性之间存在根本张力。** 你给 AI 越多自主权（让它像同事一样自己判断、自己推进），它在错误方向上走得越远。你给它越多约束（每一步都要确认），它就退化成了工具，"同事"的体验就消失了。

· · ·

## 四、第二个深水区：判断的本质是偏好，AI 替代不了

讨论到这里，一个更根本的问题浮出水面：**为什么 AI 防不了方向性跑偏？**

因为判断不是推理。

AI 擅长的是推理——给定前提和规则，推出结论。"这段代码有没有 bug""这封邮件语法对不对""这份数据有没有异常"——这些是推理问题，AI 能做，而且做得很好。

但判断不是这样。判断是在多个都"说得通"的选项之间做取舍，而取舍依据的是价值观、审美、风险偏好、战略意图。这些东西没有对错之分，只有"你想要什么"之分。

五条新闻都有话题性，选哪条取决于你的内容策略——你是想做行业深度定位，还是追热度流量？技术方案 A 和 B 都能跑，选哪个取决于你三个月后的产品方向。这些偏好不在任何数据里，推导不出来，它们在你脑子里。

## 判断有时候的本质就是偏好，而偏好是不可推理的。

理解了这一点，再看两个行业里常被提到的解法，就会发现它们其实不够：

**"让两个 AI 互相审查"（双人制）。** 听起来合理，但两个 AI 互相审查的是什么？是逻辑一致性，是事实准确性，是代码有没有 bug。这些它们能查。但"方向对不对"它们判断不了——因为"对不对"在这里根本不是逻辑问题，是偏好问题。两个没有偏好的实体，审查不出偏好上的偏差。

**"设一个专门挑刺的 AI"（adversarial review）。** 以什么标准挑刺？给它一套固定标准（检查质量、安全性、性能），它会变成一个机械的 checklist 验证器——该挑的挑不到，不该挑的反复提醒。真正有价值的 review 恰恰是那些不在 checklist 上的东西——"你这个方案能跑，但我觉得方向不对"。更隐蔽的问题是：挑刺 AI 和执行 AI 用的是同一个底层模型，它们共享相同的知识、相同的推理模式、相同的盲区。一个 Claude 写出来的方案，另一个 Claude 大概率会觉得"逻辑上没问题"——因为它们的认知是同构的。

· · ·

## 五、Dream 的困境：没有人类反馈的经验，只是局部最优

回到 Helio 提出的 Dream 机制。这个设计思路是：白天积累经验，晚上整理记忆，第二天带着优化后的认知回来。听起来很美。

但要形成真正的"经验"，需要一个关键环节：**评价标准。**

一个实习生每天写工作日志，但从来没有主管给他做 review。他会越来越熟练，但不一定越来越正确。因为他没有外部信号告诉他"这件事你做对了""那个方向你选错了"。他只能用自己能观察到的信号来优化——比如"老板今天没骂我，说明我做得还行"。

AI 的 Dream 面临同样的问题。如果 Dream 只是 AI 自己回顾自己的对话，那它的优化方向完全取决于 AI 自己对"什么算好"的判断。最直接的信号是"人类有没有给负面反馈"——于是 AI 会朝着"减少人类负面反馈"的方向优化。这听起来合理，但**减少负面反馈不等于做出正确决策**。

更麻烦的是你经常会遇到这种情况：很多事短期有坏处但长期有好处。比如你让 AI 写的推文引发了一些争议，短期看是负面反馈（有人骂了），但长期看可能是好事（引发了讨论、增加了曝光、建立了观点鲜明的品牌形象）。AI 的 Dream 会怎么处理？大概率会把"引发争议"归为负面经验，下次写东西更保守、更中庸。结果你的内容从"有观点"变成了"正确的废话"。

**这就是局部最优陷阱——AI 在每一步都朝着当前能观察到的最优方向调整，但全局来看走向了一个平庸的均衡点。**

从 Helio 公开的设计来看，Dream 的 changelog 是可审阅可回滚的，这意味着人类可以事后检查 AI 学了什么、不同意就回滚。这比纯粹的 AI 自嗨要好。但它仍然是**事后审查**——AI 自己决定学了什么，你事后看看觉得不对就改。如果你不去主动检查呢？如果 changelog 太长你懒得细看呢？

一个真正有效的 Dream 机制，可能需要把人类的反馈**主动引入**学习过程：你在频道里说"这个方向不对，换一个"，Dream 应该能把这条反馈提炼成持久化偏好；你说"好的，就这样"，Dream 应该能把当前的选择逻辑强化。但这需要非常精细的反馈提取和偏好建模，从目前的公开信息来看，不确定 Helio 在做这个层面的事情。

· · ·

## 六、那怎么办？四种可能的方向

问题提了这么多，有没有解？

坦率说没有完美解。但有几个方向值得思考，每种都有 trade-off：

**方向一：偏好前置。** 不要让 AI 做了再来审查，而是在执行前就把你的偏好和意图表达清楚。这其实是 CLAUDE.md / SOUL.md 在做的事——不是规则文档，是偏好文档。"选新闻的时候优先选深度话题而不是热度话题""技术方案优先选简单方案，我们是一个人的团队扛不住复杂架构"。

问题是：很多偏好你自己也说不清楚。它们是在具体情境下才浮现的——你看到五条新闻才知道自己想选哪条，事先写不出规则。

**方向二：渐进式校准。** AI 不是一次性学会你的偏好，而是通过反复的"做→你反馈→调整→再做"循环，逐步逼近你的偏好。这有点像推荐算法的冷启动——前几次不准，但随着你的正负反馈积累，越来越准。

这可能是最有希望的方向，但需要两个条件：一是 AI 要能精细地从你的自然语言反馈里提取偏好信号（不只是"好/不好"的二元判断），二是偏好模型要能处理场景依赖性（你在 A 场景下的偏好不等于 B 场景下的偏好）。

**方向三：分层自主。** 把判断分成"可委托"和"不可委托"两类。代码有没有 bug、邮件格式对不对——这些是技术性判断，可以全权委托给 AI。选什么方向、做不做这个功能、用什么调性写文案——这些是偏好性判断，必须人类来。

难点在于：这条边界本身也需要判断——什么算"可委托"，不同人、不同项目、不同阶段完全不同。

**方向四：AI 做参谋，不做同事。** 与其让 AI 替你判断选哪条新闻，不如让它呈现五条新闻各自的优劣和适用场景，你来选。与其让 AI 替你决定技术方案，不如让它列出三个方案和各自的 trade-off，你来定。

这是最诚实的定位，但也意味着放弃了"AI 同事帮你干活你只管看结果"的体验承诺。

· · ·

## 七、AI Agent 行业是不是在过度承诺？

聊到这里，可以回到 Helio 了。

Helio 提出的"AI Native Workforce"这个命题是有价值的——它迫使我们认真思考 AI 从工具进化为同事到底意味着什么、卡在哪里。它在产品设计上做的几层思考（身份、自主、上下文、记忆、问责），作为一个框架确实比现有的 AI 工具想得更远。

但思考这个命题的价值，不等于这个产品已经实现了这个命题。Helio 公开的技术细节太少，很多关键功能还在 Coming soon 状态，实际效果无法从外部评估。至于它能做到什么程度，需要等它公开更多技术细节、有更多真实用户反馈之后才能判断。

不过，Helio 面对的这些难题也不只是它一家的。Claude Code、OpenClaw、Cowork，乃至整个 AI agent 行业，都在面对同一个根本矛盾：**AI 能干活但不会判断，能执行但不懂取舍。** 能力瓶颈不在模型的智力水平——当前的模型已经很强了。瓶颈在于判断力，而判断力的核心是偏好，偏好是人类的东西，推理不出来。

"AI 同事""AI workforce""你只管说要干什么"——这些叙事很性感。但和当前模型的实际判断力之间，有一个相当大的 gap。

**也许当下最诚实的定位不是"AI 同事"，而是"你带着几个能力不差但需要你把方向的实习生一起干"。** 你省的是执行的时间，省不了判断的精力。这不丢人——省掉执行时间已经是巨大的生产力提升了。

过度承诺反而有风险。用户带着"AI 同事帮我干活我只管喝咖啡"的预期进来，第一次发现 AI 跑偏就会失望离场。不如一开始就把预期校准：AI 是你最勤快的实习生，但你得当好它的主管。

至于什么时候 AI 能真正从实习生升级成同事——那大概要等模型本身在判断力、偏好理解、元认知上有质的突破。到那一天，Helio 的这套基础设施也许正好能接住那个能力。但那一天还没到。

我们能做的，是在等待的同时，把问题想清楚。

我建了一个AI学习群，目前几十来人，都是在真正动手学AI的人。如果你也在自己跑模型、写代码、做项目，欢迎加我微信，备注"你在做的AI方向"，我拉你进群。纯围观的就不加了，群里大家都在真搞。

![](images/0cc686/img_002.jpg)
