# 最近模型更新体验分享: Grok 4.5、Claude Fable、GPT-5.6 初体验

V2EX 热门 · score 68.4 · 7/9/2026, 11:53:14 PM

摘要

# 最近模型更新体验分享:Grok 4.5 、Claude Fable 、GPT-5.6 初体验 这几天更新的模型比较多,我来分享一下自己实际使用后的体验,也欢迎大家一起讨论关于 Ai WorkFlow 的设计开发 ## 使用背景 我的主要使用场景: * 程序开发网站设计 * 一点点安全相关工作 * OPC 以下内容全部基于个人实际工作流体验,不是跑分测试。 --- # 总结 先说结论: * **Grok 4.5 这次升级非常惊艳,提升非常明显。对标满血 Opus 4.6** * **Claude Fable 5 High 暂时没有让我感觉到与满血 Opus 4.6 的代际提升。** * **GPT-5.6 Sol 目前没有体验到特别明显的代际提升。** 这次体验之后,我自己的工作流也发生了一些变化。 之前: * Codex:主要负责开发 * Claude:辅助 现在: * Grok 与 Claude 讨论共同设计方案 * Codex:负责代码开发 --- # 1. Claude 旗舰模型 ## 模型 Fable 5 High ## 渠道 * Max 20 * 中转站 ## 使用体验 价格大概是 Opus 的 2 ~ 3 倍。 但是实际使用下来,我没有感觉到它相比满血版本的 Opus 4.6 有非常明显的提升。 它确实会聪明一些,推理能力也有所增强。 但是最近这段时间,Opus 本身的实际表现下降比较明显,所以 Fable 带来的提升,有一部分可能来自对比基准下降。 如果和几个月之前状态最好的满血 Opus 4.6 比较,我没有感觉到特别明显的代际差距。 --- ## 最大的问题:安全限制影响工作流 目前最大的问题,是 Cyber 相关限制出现频率非常高。 例如: * 分析自己的 Server 日志 * 查找系统崩溃原因 * 优化服务器性能 这些正常运维场景,也可能触发安全阻断。 模型会判断这些行为可能涉及网络攻击,然后停止继续执行。 这对于实际开发和运维场景影响比较大。 个人感觉 Claude 目前在安全策略方面收得比较紧,导致一些正常用户场景体验下降。 --- # 2. Grok 4.5 ## 模型 Grok 4.5 (High) ## 渠道 Super Grok 套餐 --- ## 使用体验 这个模型真的让我感觉非常惊艳。 整体体验非常接近高阶模型的满血状态。 它给我的感觉: * 推理能力提升明显 * 任务推进能力强 * 限制相对少 * 更偏向解决问题,而不是提前终止任务 在复杂任务规划方面表现很好。 例如: 我测试让它分析 TikTok APP 的逆向方向,包括登录协议相关内容。 它给出的: * 分析思路 * 技术路线 * 初步执行计划 整体方向判断非常准确。 --- ## Grok 最大优势:生产力导向 相比部分模型,Grok 给我的感觉更加偏向: > 先帮助用户把事情推进起来。 而不是: > 先判断这个事情是否存在风险,然后停止执行。 对于开发、研究、排查问题,这种差异非常重要。 --- # 3. GPT-5.6 Sol ## 模型 GPT-5.6 Sol Medium ## 渠道 Pro 20 套餐 --- ## 使用体验 之前 GPT-5.5 给我的体验其实很好。但是最近一段时间,5.5 的实际表现下降比较明显,一些任务中可以明显感觉到能力下降。(由于 GPT-5.6 凌晨才用上。只是初步体验,还没有进行大量深入测试。) 和之前状态比较好的 GPT-5.5 相比: 目前没有感受到特别明显的提升。 不过有一点比较明显: GPT-5.6 现在也出现了更多 Cyber 相关限制。 在一些正常开发、安全研究、系统分析场景中,会影响连续工作流。 --- # 综合评价 这次模型更新里面,我个人感觉: ## Grok 4.5 目前提升最明显。 已经正式加入我的工作流: --- # 另外推荐一个 Grok 使用方式 Grok 做搜索和信息整理,非常强。 尤其是结合 MCP: Grok MCP: * 搜索信息 * 收集资料 * 整理 X 平台用户讨论 * 输出分析结果 实际体验下来: 它收集 X ( Twitter )上的真实用户反馈、讨论趋势,非常好用。 相比传统 Web Search 好很多 --- 以上只是个人实际使用体验,不代表跑分成绩。 欢迎大家分享自己的测试结果。