我现在主要用Codex (因为还可以用chatGPT做无流量限制的brainstorming和二次prompts生成), Obsidian用来统一规划所有文档 - 计划,详细过程,结论。Claude 和 Cursor打辅助 (通常是token不够用的情况顶上)。下面是我常用的流程,分享一下欢迎讨论:
**第一步,先跟AI描述一个具体问题**,补充所有必要细节,或者给它几篇高质量参考文献,让 AI 先做一轮完整的 research。接着进入 *Grill-me* 环节:通常限制在 20-30 个问题一问一答的方式,我大概需要 1-2 小时逐个回答。
通过这些问题会逼我更深入思考和解释清楚:研究命题是什么?数据应该怎么用质量如何?benchmark、成本与 capacity 怎么定义?什么结果才算通过?需要做什么样的延申?什么情况说明这个 idea 不成立?
等这些边界被确认后,再由 agent instructions 里的 harness 和 looping engineering 接管执行 - 而这些是在长期使用过程中不断积累和改进的。
通过 任务拆解 -> 代码实现 -> 循环验证 -> 异常恢复 -> 结果检查 到最后的 报告生成,通常会在之后 2-6 小时完成。
为什么我愿意先花 1-2 小时“被拷问”? 我以前工作过的一家约 50 亿美元规模的 HF,老板说过一句让我印象很深的话:
**少做那些只让自己 feeling better 的事情**
比如,拿已经熟悉的代码改几行,测试一个新的 signal variant,很快得到几页漂亮的 PDF reports。过程很顺,反馈也很好,但新增的信息量可能很低,甚至只是 overfit、样本选择或参数偶然性。



