- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月16日 10:35
- 状态
- 单一信源
发生了什么
该研究在460个编程任务(Python和Java各半)中,对比了GPT-4o mini、DeepSeek和Claude在英语、中文、印地语、西班牙语、意大利语提示下的代码生成质量。结果显示:英语提示并不总是产生最佳功能正确性或代码质量;提示语言的影响取决于编程语言和具体LLM;生成的代码常混合英语与提示语言(注释、字符串字面量)。这是首个公开的多语言代码生成语言偏差基准。
为什么重要
此前业界普遍假设英语提示能获得最佳代码质量,本研究通过系统实验证实该假设不成立,非英语提示可能输出更优结果,且不同模型对语言偏好的响应差异显著,挑战了当前多语言代码生成产品的默认策略。
底层逻辑
LLM训练数据中英语占比远高于其他语言,导致模型对不同自然语言的理解和生成能力不均衡。当提示语言与编程语言(如Java)或LLM训练语料有不同交互时,代码功能正确性、结构质量及语言混合行为出现差异,例如非英语提示可能迫使模型更关注任务逻辑而非套用模板。
产品与商业机会
产品若面向非英语用户,需评估不同提示语言对代码质量的实际影响,不可默认使用英语提示;代码中注释和字符串混用多语言会增加后续维护和国际化成本;需针对不同编程语言和模型调整提示语言策略。
- 对多语言用户提供提示语言选择功能,并自动推荐经测试效果最佳的语言(如为Python任务推荐印地语而非英语)
- 开发代码审查工具,自动识别并标记注释与字符串中的语言混用问题,建议统一为英语或目标语言
- 为不同LLM和编程语言组合创建语言偏差映射表,辅助产品配置默认提示语言
仍待确认
- 本研究的发现是否适用于其他LLM(如Gemini、Llama系列)?
- 在真实生产环境中(非基准测试),语言偏差对代码长期可维护性的实际影响有多大?
- 用户自身语言偏好是否会改变模型输出的最佳语言选择?