AI 模型怎么选才适合工作?Synology 四周盲测:没有绝对赢家,真实办公更看重复工率与成本

图片.png

Claude、Grok、GPT 综合表现接近,GPT 得分略高但负面反馈更多;Gemini 未显突出。

AI 助手正逐渐成为办公默认工具。写回复、总结长邮件、为全球团队翻译资料、把零散笔记整理成可发送内容,都已经离不开它。但“哪个模型最好”并没有简单答案。品牌印象、界面差异,甚至一次不顺畅的交互,都可能迅速影响判断。

为此,Synology 组织了一次内部盲测,希望从真实工作场景中找到更接近实际的答案。

四周盲测:147 份反馈,覆盖数十个团队

实验持续四周。Synology 全球员工在 Synology Office 和 MailPlus 中使用 AI 功能。Synology Office Suite 允许企业接入自选 LLM,并通过去标识化层保护内容隐私。参与者每周被随机分配使用 Claude、Gemini、GPT 或 Grok 中的一款,且全程不知道自己在用哪个模型。

这不是实验室基准测试。提示词没有统一,任务也没有严格控制。员工做的是实际工作,例如润色邮件草稿、检查报告语法、翻译销售材料等。随后他们填写简短周度调查。四周共收到 147 份反馈,来自数十个团队。需要说明的是,这并非严格科学测试,但结果仍有参考价值。

前三名差距很小,但反馈质量不同

综合质量得分上,Claude、Grok 和 GPT 非常接近,差距只有几个百分之一分。对于前沿 LLM 来说,这种接近并不意外。更值得注意的是,GPT 最终以微弱优势超过 Claude,却收到了明显更多的负面反馈。
AI 模型怎么选才适合工作?Synology 四周盲测:没有绝对赢家,真实办公更看重复工率与成本

各模型的强项比总排名更清晰。Claude 在准确性和深度上领先,适合最看重正确性和解释的工作。Grok 在“重试满意度”上表现突出,也可以理解为遵循指令的能力更强。这一点很关键,因为反复来回沟通,是让 AI 助手从有用变烦人的最快方式之一。Gemini 没有在某一指标上特别突出,可能因为它是测试中版本最旧的模型——测试开始时 Gemini 3 尚未推出。
AI 模型怎么选才适合工作?Synology 四周盲测:没有绝对赢家,真实办公更看重复工率与成本

真正拖慢效率的,是这些摩擦

定性反馈显示,影响体验的主要问题包括:指令遵循不佳,需要多轮才能达到合适语气、结构和正确性;回答虽然技术上正确,但太长或太保守,反而增加工作量;上下文纪律不足,例如基于错误上下**假设,没能理解后续邮件中会议时间已经更改。

这些问题很难量化,却直接决定 AI 助手是节省时间,还是只是噱头。即使在盲测中,不同模型的行为差异也稳定出现。有些模型即使被要求简洁,仍默认生成更长初稿,在邮件和写作场景中反而拖累效率。有些模型在模糊情况下更倾向安全、含糊的回答,减少争议或错误风险,却让想要明确建议的用户感到失望。

成本不只看每 token 单价

这次试点还发现,实际成本很难仅凭每 token 费率预测。不同模型的 token 使用行为差异明显,即使提示词和参考文件完全相同。测试中推理功能大多关闭或调到最低,但 LLM 本身具有非确定性,模型运作方式仍可能大不相同。
AI 模型怎么选才适合工作?Synology 四周盲测:没有绝对赢家,真实办公更看重复工率与成本
AI 模型怎么选才适合工作?Synology 四周盲测:没有绝对赢家,真实办公更看重复工率与成本

Synology 还做了一次小型效率测试,结果与全组织范围的主要测试一致。简而言之,价格和效率差异都不小。Claude 总体反馈最好,但企业必须考虑:它是否值得比 Gemini 或 GPT 高出两倍以上的价格?把 Grok 放进比较,甚至也显得不太公平。成本数据为四舍五入。实际启示是,成本可能大幅波动,企业应像管理 IT 供应商一样,定期检查 AI 服务的质量与成本。AI 模型进步极快,跟上变化非常重要。

对企业部署 AI 的启示

结论很直接:AI 不是“设置完就不管”。测试只持续四周,期间提供商就发布了重大更新,改变了模型行为、质量和成本。如果企业要把 AI 用于核心工作流,就需要一个轻量机制,持续验证原有假设是否仍适用于自身环境。

AI 在日常知识工作中已经展现价值,尤其是写作、摘要和翻译。真正重要的是重试次数、准确性,以及员工是否愿意在少量编辑后直接提交成果,从而实际节省时间。

这次评估之所以可行,还因为测试在 Synology Office 和 MailPlus 内进行,并在用户内容与模型提供商之间启用了去标识化层。企业生产力不仅取决于 LLM 本身,也取决于系统能否融入员工工作流,并符合公司数据安全政策。这正是 Synology AI Console 的核心目标:帮助组织在跟上 AI 生态演进的同时,确保数据安全。

准备好弥合 AI 生产力与数据安全之间的差距了吗?


下一页:没有更多内容了~