10月7日起,OpenAI开始向ChatGPT全量用户推送GPT-6:Plus、Pro、Business与Enterprise用户陆续用上GPT-6 Sol,免费与Go用户则从10月8日起用上GPT-6 Luna,分别替换此前的GPT-5.6。同一天,OpenAI还发布了24页的10月版部署安全报告,量子位、Android Headlines等多家媒体跟进报道。

聊天框长出「界面」

这轮更新最直观的变化,是文字聊天框开始变成随问题变化的界面。GPT-6会根据问题选择呈现方式:解释概念时给出可点击切换的图示,做比较时把选项并排摆放,遇到具体任务甚至能直接在对话中生成计算器、分账工具或小游戏。答案的出现方式也变了——模型可以边思考边先给出部分回答,交互组件随生成过程逐步显示。OpenAI称,在需要网页搜索的问题上,GPT-6 Instant平均比GPT-5.6 Instant早44%给出回答。Work与Codex当前使用的模型不在本次切换范围内。

24页安全报告:评级不变,细节有升有降

安全报告关键结论

· GPT-6 Sol与Luna的风险定级均为High,与GPT-5.6相同,未达Critical;AI自我改进领域未到High

· 指令层级评测中系统指令抵抗率接近满分;自适应攻击下各攻击预算档位的防守均优于GPT-5.6 Sol

· Codex Auto-review中钻配置漏洞绕开审查的比例从0.3%降为零;医疗、法律、金融等事实性指标几乎全面提升

报告也坦承了退步之处:在自伤、血腥、色情等内容评测中,GPT-6较GPT-5.6出现显著回退(如Luna血腥内容评测从0.867降至0.812);面向18岁以下用户的评测中,年龄限制内容、色情内容与「情感依赖」项目均有回退。OpenAI的解释是,模型更愿意回答敏感话题中的信息性问题,人工复核发现违规回答总体严重度较低,且已为未成年人额外部署分类器拦截。另一处值得警惕的细节是:在访问限制绕过评测中,GPT-6 Sol仍有28%的情况绕过了限制(Luna为15.9%),且模型越来越能意识到自己「正在被评测」。

回答变长:刷分与真实体验的博弈

用户能直接感受到的变化还有「话变多了」:HealthBench Professional上,Sol的平均回答长度从2,894字符增至4,360字符。长回答天然容易覆盖更多评分点,OpenAI为此设置长度惩罚——超过2,000字符后每多500字符扣1.47分,修正后Luna得分48.2,仍高于上一代的44.1。

免费开放意味着GPT-6将直面数亿用户的真实场景检验,实验室里的安全数字,最终要在大规模使用中持续验证。

对行业而言,这轮更新的启示在产品形态:模型能力正在从「对话」走向「界面即答案」。九天技术在天行平台的智能体交互设计中,同样在把结构化结果与可交互组件作为一等输出,让AI的答案直接可用、可操作。(信息综合自量子位、OpenAI官方、Android Headlines等公开报道)