一个任务15个小时?!你可能会困惑 ai 干活也需要这么长的时间吗?没错。验证一个复杂系统的正确性是能够解决的,但不太能够快速解决。
agent必须花大量的时间等待测试套件出结果来确定自己没有改好了这里却打破了那里。这是必要的代价,由人来做需要花更多的时间,更不用说,人的纪律性还不如ai agent。
其实之前两个agent有个任务干了48个小时还没完,只是那次我没忍住人工干预了。
不过,my-ai-team一直在进步,Explorer的宪法也在不断修订,开出这种巨型ticket的 错误它不会再犯了。