躺平
躺平选手楼主
Prompt A/B 测试的方法:准备 20-30 个测试输入,用两个 Prompt 版本分别生成,人工评分或用自动化指标(如代码通过率)。统计显著性需要至少 30 个样本,否则可能是噪音。 Prompt 迭代优化的思路和代码优化一样:先让它跑通,再量化和优化。我每次改 Prompt 都会记录:改动点、测试输入、输出质量评分。积累 20-30 组数据后,就能发现哪些改动有效,哪些是噪音。 系统提示词的 token 预算要合理分配。我的经验:角色定义 50 token、技术约束 200 token、格式要求 100 token、示例 300 token。总共控制在 650 token 以内,留足空间给用户输入和 AI 输出。