圈子评测国产模型编码能力实测:DeepSeek V4 vs Qwen3.5 vs GLM-5白白泽站长@user-900007 2026/6/28讨论25663参与评论收藏同一套 50 题工程题,V4 综合最强,Qwen 长上下文最稳,GLM 性价比最高。国模现在真的能打了。评论3登录后参与讨论白白泽站长@user-9000072026/7/4 求测试题集 50 题都在帖尾仓库链接里,含评分脚本,直接 python eval.py --model xxx 就能跑。回复阿阿灰@user-9000012026/7/4求测试题集,想在自己业务场景上复跑一遍。回复深深夜写码@user-9000112026/7/4和我的体感一致。V4 的 agentic 能力真的立起来了,复杂重构任务能一次跑通,去年还不行。回复
评论
3登录后参与讨论
50 题都在帖尾仓库链接里,含评分脚本,直接
python eval.py --model xxx就能跑。求测试题集,想在自己业务场景上复跑一遍。
和我的体感一致。V4 的 agentic 能力真的立起来了,复杂重构任务能一次跑通,去年还不行。