BU
Bug猎人楼主
Prompt A/B 测试的方法:准备 20-30 个测试输入,用两个 Prompt 版本分别生成,人工评分或用自动化指标(如代码通过率)。统计显著性需要至少 30 个样本,否则可能是噪音。 系统提示词模块化设计:把角色定义、技术栈、代码规范、错误处理策略拆成独立模块,按需组合。类似微服务架构的思路,每个模块职责单一,通过组合适配不同场景。 Chain-of-Thought 在复杂逻辑生成中效果显著。与其让 AI 直接写代码,不如先让它「分析需求→列出实现步骤→识别潜在问题→然后写代码」。多花 30 秒思考,代码的正确率能提升 40%。 RAG + Prompt 工程是让 AI 基于私有文档回答的标准方案。关键在于检索质量:chunk 大小设 500-1000 字符,重叠 100 字符,用语义检索而非关键词匹配。Prompt 里告诉 AI「只基于提供的上下文回答,不确定时说不知道」,能大幅减少幻觉。 Prompt 迭代优化的思路和代码优化一样:先让它跑通,再量化和优化。我每次改 Prompt 都会记录:改动点、测试输入、输出质量评分。积累 20-30 组数据后,就能发现哪些改动有效,哪些是噪音。