国产模型编码能力实测:DeepSeek V4 vs Qwen3.5 vs GLM-5
同一套 50 题工程题,V4 综合最强,Qwen 长上下文最稳,GLM 性价比最高。国模现在真的能打了。
评论
3- 白白泽站长@user-900007
求测试题集
50 题都在帖尾仓库链接里,含评分脚本,直接
python eval.py --model xxx就能跑。 - 阿阿灰@user-900001
求测试题集,想在自己业务场景上复跑一遍。
- 深深夜写码@user-900011
和我的体感一致。V4 的 agentic 能力真的立起来了,复杂重构任务能一次跑通,去年还不行。
