5月5日2026年,OpenAI为ChatGPT的所有用户推出了新的默认模型GPT-5.5 Instant,在高风险查询中的幻觉减少了52.5%。
无声但重要的替代
继2026年3月3日推出GPT-5.3 Instant仅两个月后,OpenAI再次轮换了其基础模型。这种每两个月的节奏似乎已成为一种惯例:该公司以钟表般的规律调整其大众化引擎,却无惊天动地的公告。这次的目标不是以前所未有的推理能力给人留下深刻印象,而是让ChatGPT对数亿每周使用它的用户来说,在日常使用中更加可靠。
OpenAI于2026年5月5日在其官方网站上发布的一篇博文中介绍了这次更新。信息很明确:Instant模型是“日常引擎”,是ChatGPT绝大多数用户每次互动都会接触到的引擎。改进这个关键环节,即使是小幅度的改进,也能产生倍增效应。
打击幻觉,用数据说话
此次更新的主要重点是减少事实错误。根据OpenAI在其官方博文中公布的内部评估,在涉及医学、法律和金融的高风险查询中,GPT-5.5 Instant产生的幻觉声明比GPT-5.3 Instant减少了52.5%。对于用户报告的特别容易出错的对话,减少幅度达到37.3%。
这些进步在外部门户测试中得到了证实。根据TechCrunch的报道,该模型在2025年AIME数学测试中得分为81.2,而其前身得分为65.4。在多模态推理基准MMMU-Pro上,GPT-5.5 Instant得分为76,而GPT-5.3得分为69.2。OpenAI还强调在图像分析、科学(STEM)推理和网络搜索管理以补充回答方面取得了显著进展。
然而,需要进行一些细微的区分。这些数据来自内部评估,该公司自己也承认,一个幻觉更少的模型可能反而会促使用户更加信任它,即使它仍然会出错。幻觉的减少是真实的,但这并不意味着它们消失了。
更少的废话,更少的表情符号
此次更新的另一个重点是风格。根据OpenAI发布的数据,GPT-5.5 Instant与前代相比,在传达相同信息时使用的词语减少了30.2%,行数减少了29.2%。回答更加直接,减少了不必要的后续问题、不自然的格式和表情符号。
OpenAI将这种演变描述为寻求平衡:在保留ChatGPT的“温暖和个性”的同时,消除该公司称之为“过度格式化”的内容。对于一个非正式的咨询请求,模型将不再采取专业报告的结构,而用户只是期待一个实用且快速的答案。这一转变并非无关紧要。在2026年2月GPT-4o下线时,用户曾发起请愿,要求阻止其贬值,并将该模型描述为“朋友”或“镜子”。OpenAI显然正在谨慎地调整其个性化策略。
https://x.com/OpenAI/status/2051709028250915275?s=20
更深的上下文记忆
此次更新的第三个维度是关于个性化。GPT-5.5 Instant更有效地利用了可用上下文:过去的对话、共享的文件,甚至用户授权连接的Gmail帐户的内容。OpenAI在其官方博文中提出的目标是,用户不必在会话之间重复自己。
最具体的新功能是引入**“memory sources”(记忆源)**,这是所有ChatGPT模型都可以使用的一个接口。它允许用户查看哪些上下文被用于个性化响应,对其进行更正或删除。如果用户与他人共享对话,则不会传输记忆源。OpenAI强调这一点:用户仍然是模型对他们的了解的主人,并且可以选择从内存中删除整个对话或手动修改已保存的元素。
这项功能使ChatGPT更接近于一个全功能的个人助理,能够适应你的专业背景、你的习惯和你的偏好,而无需你在每次会话中重复你的偏好。
部署:谁可以访问,以及在什么条件下
GPT-5.5 Instant的部署于2026年5月5日开始,面向所有ChatGPT用户,包括免费帐户。拥有Gmail和文件访问权限的高级个性化功能将优先面向Web上的Plus和Pro订阅用户推出,随后将扩展到移动应用程序,然后在未来几周内扩展到免费用户。记忆源现已在Web上向所有大众市场帐户提供,然后将扩展到移动设备。
对于付费用户,GPT-5.3 Instant仍可访问三个月,然后将被永久移除。开发人员可以通过API使用chat-latest别名访问新模型。
我们还必须将GPT-5.5 Instant置于OpenAI更广泛的产品架构中。上个月,该公司推出了GPT-5.5 Thinking和GPT-5.5 Pro,这些模型被定位为适用于复杂任务的模型:高级编码、深入研究、长时间工作流程。GPT-5.5 Instant是速度和日常使用的模型。它速度更快,专为常规交互而设计,并且OpenAI表示其延迟与GPT-5.3相同。
此次更新证实了OpenAI战略的一个基本趋势:完善绝大多数用户的体验,而不是将精力集中在为少数人保留的尖端性能上。对于每天打开ChatGPT数次的任何用户来说,问题不在于GPT-5.5 Instant能否解决奥林匹克级别的数学问题,而在于它在医学或法律问题上的答案是否真的更可靠。根据这一标准,OpenAI发布的数字表明了显著的进步。
