DeepSeek-V3 在代码生成领域一直口碑不错。但我们不满足于刷 HumanEval 分数,而是用真实项目来测试。
测试项目
一个迷你电商后端 API,包含:
- 用户注册登录(JWT)
- 商品 CRUD
- 购物车管理
- 订单创建与支付回调
- 数据库迁移脚本(PostgreSQL)
测试过程
我们用 DeepSeek-V3 从头开始写,记录每一轮的生成结果和人工修正量。
第 1 轮:项目框架 + 数据库设计
提示:“用 Express + TypeScript + Prisma 搭建一个电商 API 项目”
DeepSeek 给出了完整的项目初始化代码:
- ✅ Prisma schema(User、Product、Cart、Order 四张表,带关联关系)
- ✅ 基础 Express 配置
- ✅ 环境变量模板
- ✅ package.json 依赖
人工修正:无。直接用了。
第 2 轮:认证模块
提示:“实现 JWT 登录注册,密码用 bcrypt 加密”
- ✅ 注册/登录路由
- ✅ Token 生成与验证中间件
- ✅ 密码加密/解密
- ✅ 输入校验基础逻辑
人工修正:补充了 refresh token 的逻辑。
第 3 轮:商品 + 购物车
- ✅ 商品 CRUD 路由
- ✅ 购物车增删改查
- ✅ 商品库存校验
人工修正:修正了一个购物车数量更新的原子性问题(需要使用 Prisma 的 update 而非 delete+create)。
第 4 轮:订单
- ✅ 订单创建(含事务处理)
- ✅ 库存扣减
- ✅ 支付回调模拟
人工修正:事务逻辑正确,但锁机制需要手动加。
最终统计
- 总对话轮数:7 轮(含修复和优化)
- 生成代码行数:约 950 行
- 人工修改量:约 15%
- 首次运行成功:第 3 轮生成的代码可运行
- 完整可用:第 5 轮
总结
DeepSeek-V3 的真实代码能力在中级工程师水平——能一口气写出完整的项目框架,但在边界条件和并发处理上需要人工审查。
对于日常 CRUD 业务、API 开发、脚本编写,它完全够用。对于并发敏感、安全关键的核心代码,还是需要人工把关。
不过考虑到 DeepSeek-V3 的 API 价格只有 GPT-4o 的 1/9,这个性价比已经非常香了。