上面是我家里的客户端使用的情况,公司的没截图。先说一下使用情况:Opencode go提供的ox-alpha模型:1.4亿
Zcode套餐提供的GLM-5.3-Flash模型:3.3亿(大部分都在低谷时期,消耗周额度53%)
Zcode免费送的GLM-5.3-Flash模型:3.1亿
火山coding/token plan提供的glm-5.3-falsh模型:4.2亿
综合评价:部分场景发挥亮眼但是短板亦很明显的次旗舰模型
智力认知:智力上限较高,在合适的指引下自我能力较强,但是在不专业的指引下会过度思考和纠结。上下文一致性能力较强。对提示词要求较高,过于复杂的提示词会影响模型智力。
功能实现与效率:多页面样式设计风格统一且美观。模型在思考的情况下,对接口的边界处理能力较强,能够比较完整的覆盖传入参数的可能情况,进行完善的异常处理。在给出参考的情况下让其模仿前后端接口调用格式,能够做到尽可能与我给的示例方法完全一致。(这里点一下ds,在读取接口文件后,对于交互方法有概率按照其更熟悉的方法进行编写,而不是去参照我的写法)
工具调用:虽然我看到模型在这块得分是相对较高的,但个人体验下来,基础工具调用大家都一样,但是如果不明确提示工具和subagent的调用,其倾向于自己逐个解决(也有可能是我在Zcode给全部权限的原因,但是在DSH中,其同样对调用工具不敏感)
复杂任务或模糊任务:模型对于修复多bug的提问,出现思考不均,多个bug分配的思考强度是完全不一样的,有时候会想当然的认为问题就出在这里,有时候又会自己绕自己。对于多任务功能实现类,整体完成情况较好(尤其是给出参考代码的情况下,其可以根据参考代码进行非常优秀的实现)。
代码可读性和解耦性:代码可读性相对较强,解耦性和规划意识不明显,其倾向于优先使用高效方法解决问题,主动去提示用户某些部分可复用/可简化的情况较少。但是如果要求其提供可读性或提高代码解耦性,模型也可以比较妥当的完成。
指令遵循:在没有强硬引导的情况下,模型倾向于自己选择解决办法,或者寻找替代办法。但是如果上下文限制长了,容易降低智力。
咸鱼
白龙


八号WT








