A Journal Through My Activities, Thoughts, and Notes
openai surprised me. I deliberately don't use another codex account to keep some token for later use. last night, my first codex account exhausted so I started to use the backup, guess what? the reset time for the back is 7 days after! my two accounts got reset 5 days ago, just because I didn't use the second one in the first 5 days, you start a brand new session for me? 离了大谱!这合法吗?
最近7天合并了213个PR。平均每小时1个多一点。我很欣慰。生活在这个时代真是幸福。感谢my-ai-team。AI时代缺啥工具不用等,自己造就好了。浪费当然有浪费,但好东西正是从一个个丑陋的小板凳里脱颖而出的。只要造轮子的人足够多,就总会有好轮子脱颖而出。
刚才在freebuff里看到一个新模型 space bunny alpha。中秋节快来了,太空兔子模型?肯定是来自中国的。deepseek和kimi家,还有bytedance家都发过了,难道是水平最差的minimax?
我正在试用,希望它给我惊喜。我可有minimax家的年订阅。哈哈
我正在试用,希望它给我惊喜。我可有minimax家的年订阅。哈哈
刚才出去跑步,天已经大黑了(晚上九点多),跑过一辆车时候听到车里有狗叫。我没有停下继续跑,但我心里一直在嘀咕,谁家的主人这么不小心?找不到自家狗也不着急吗?
跑出去一百多米以后我实在受不了,就又折了回来,临近车子的街边房子亮着灯,我鼓足勇气敲门,敲了好几下,没有人应门,我正准备撤的时候门开了。一个推着助行车的老太太和一个大男孩,我问那车是他们的吗,老太太说是的。我说你们的狗被锁里面了。老太太说知道,狗就住车里。我说狗一直叫,她说知道,她在屋里也能听见,不过不用担心,“她(那只狗)都习惯住车里了”。她谢谢我对她狗狗的关心,又问我是不是也住这条街上。我说只是隔壁街,我出来跑个步。既然狗子没事儿,我就放心了。拜拜。
但拜完了,我还是替狗子鸣不平。哎人会生错人家,狗子也会啊。很好看的狗狗,是和丁丁的白雪一样可爱的狗狗,锁在车里一呆就是一晚上。哎!
跑出去一百多米以后我实在受不了,就又折了回来,临近车子的街边房子亮着灯,我鼓足勇气敲门,敲了好几下,没有人应门,我正准备撤的时候门开了。一个推着助行车的老太太和一个大男孩,我问那车是他们的吗,老太太说是的。我说你们的狗被锁里面了。老太太说知道,狗就住车里。我说狗一直叫,她说知道,她在屋里也能听见,不过不用担心,“她(那只狗)都习惯住车里了”。她谢谢我对她狗狗的关心,又问我是不是也住这条街上。我说只是隔壁街,我出来跑个步。既然狗子没事儿,我就放心了。拜拜。
但拜完了,我还是替狗子鸣不平。哎人会生错人家,狗子也会啊。很好看的狗狗,是和丁丁的白雪一样可爱的狗狗,锁在车里一呆就是一晚上。哎!
我的codex一直是gpt-5.6-luna xhigh,昨天升到6-luna max。当然没法跟asta比,但人家发挥一直是很稳定的,不知道为啥一些人狂骂luna笨,用过haiku4.5吗,那才是真笨。关键是luna价格良心,量足啊。没有luna,我一周这百十个PR钱包会哭死。眼见还有两天reset,我另一个codex账号尚满血,决定换 gpt-6-sol high,给agent们吃点好的,打打牙祭。
比较有意思了!sonnet5.5和haiku5.5 is coming!
我好期待。希望sonnet5.5和haiku5.5也能至少像luna 那样能打又足够低价。中国的模型们也要加油哦。我热烈的欢迎你们打价格战,打得越激烈越好 :D
我好期待。希望sonnet5.5和haiku5.5也能至少像luna 那样能打又足够低价。中国的模型们也要加油哦。我热烈的欢迎你们打价格战,打得越激烈越好 :D
今早我发在公司AI论坛里的一个贴子
Anyone allow agents to merge your PR on your side projects? I allow them. Agents write better code, made better decisions when having a good harness. I developed a suite called my-ai-team, where Explorer agents write better tickets than human, Delivery agents deliver "Ready" issues 7x24x365 automatically, and independent Reviewers constantly push back not-good-enough plans and implementations, and approve and merge them when they are good enough and pass the CI check.
You might say, AI mistakes. Sure, human beings make mistakes as well. The way I take on my side projects is I have an independent Auditor agent who is responsible to the quality of the merged code, just like what we did for "test in main". It checkes newly merged PRs and do extra check. When there are no new PRs, it also scans the code base regularly to find the bugs, bad smells, duplicate code, bad test coverage, even design issues etc, then convert them into well-written issues.
Surely, allowing agents to merge PRs at work is still a distance to walk through. However, for you side projects, it is worth a try!
虽然在我现在就职的公司还不允许 AI自动合并代码,但这一天终会到来,无非早一点或者晚一点。早一点拥有my-ai-team, 就早一点解放你的生产力。
现在是早上6:43分,在我起床前的2个小时内,ai team已经自我进化合并了4个PR,发布了4个版本。
!image
Anyone allow agents to merge your PR on your side projects? I allow them. Agents write better code, made better decisions when having a good harness. I developed a suite called my-ai-team, where Explorer agents write better tickets than human, Delivery agents deliver "Ready" issues 7x24x365 automatically, and independent Reviewers constantly push back not-good-enough plans and implementations, and approve and merge them when they are good enough and pass the CI check.
You might say, AI mistakes. Sure, human beings make mistakes as well. The way I take on my side projects is I have an independent Auditor agent who is responsible to the quality of the merged code, just like what we did for "test in main". It checkes newly merged PRs and do extra check. When there are no new PRs, it also scans the code base regularly to find the bugs, bad smells, duplicate code, bad test coverage, even design issues etc, then convert them into well-written issues.
Surely, allowing agents to merge PRs at work is still a distance to walk through. However, for you side projects, it is worth a try!
虽然在我现在就职的公司还不允许 AI自动合并代码,但这一天终会到来,无非早一点或者晚一点。早一点拥有my-ai-team, 就早一点解放你的生产力。
现在是早上6:43分,在我起床前的2个小时内,ai team已经自我进化合并了4个PR,发布了4个版本。
!image
#mat 同一个repo最好有两个AI delivery team来消费backlog。这样万一一个卡住,等待人工处理期间,另一个team仍然可以继续取得进展,让backlog里的等待列表快速变短。
!image
这张图告诉我们,
- gpt-6-luna xhigh 不要用
- gpt-6-sol max 不要用
- claude-opus-5 high 不要用
来源 <https://openai.com/index/introducing-gpt-6-sol-and-luna/>
这张图告诉我们,
- gpt-6-luna xhigh 不要用
- gpt-6-sol max 不要用
- claude-opus-5 high 不要用
来源 <https://openai.com/index/introducing-gpt-6-sol-and-luna/>
自从用上my-ai-team以来,我再没有抱怨过ai 降智。ai读你的小九九读对了,你觉得啊它真聪明,简直是我肚里的蛔虫。读错了,小笨蛋,你怎么降智了。
人很少怀疑是不是自己没有提供足够清晰准确的输入。人有长期记忆,agent没有。人以己度agent,难免有偏差。
所以,好好写票,把票写好是重中之重。而人又是出了名的懒惰,不爱出力气,写个票恨不能一句话就结束。
这就是为什么我开发Explorer agent来帮我写票。我还是就写一句话或者一段话,ta替我做调查,写出agent清晰易懂的好票。有了这么好的输入,agent犯错的机会当然就大大减少了,最重要的,你不用“盯盘”(babysit),你的身心健康都更好了!
“好好写票,把票写好”被我写到Explorer的宪法里,而我呢,则可以一如既往的当伸手大爷,我只动动嘴儿,agent们就心甘情愿地跑断腿儿。
好了,我要去跑步了。等会儿回来再检查作业。lol
人很少怀疑是不是自己没有提供足够清晰准确的输入。人有长期记忆,agent没有。人以己度agent,难免有偏差。
所以,好好写票,把票写好是重中之重。而人又是出了名的懒惰,不爱出力气,写个票恨不能一句话就结束。
这就是为什么我开发Explorer agent来帮我写票。我还是就写一句话或者一段话,ta替我做调查,写出agent清晰易懂的好票。有了这么好的输入,agent犯错的机会当然就大大减少了,最重要的,你不用“盯盘”(babysit),你的身心健康都更好了!
“好好写票,把票写好”被我写到Explorer的宪法里,而我呢,则可以一如既往的当伸手大爷,我只动动嘴儿,agent们就心甘情愿地跑断腿儿。
好了,我要去跑步了。等会儿回来再检查作业。lol
一个任务15个小时?!你可能会困惑 ai 干活也需要这么长的时间吗?没错。验证一个复杂系统的正确性是能够解决的,但不太能够快速解决。
agent必须花大量的时间等待测试套件出结果来确定自己没有改好了这里却打破了那里。这是必要的代价,由人来做需要花更多的时间,更不用说,人的纪律性还不如ai agent。
其实之前两个agent有个任务干了48个小时还没完,只是那次我没忍住人工干预了。
不过,my-ai-team一直在进步,Explorer的宪法也在不断修订,开出这种巨型ticket的 错误它不会再犯了。
agent必须花大量的时间等待测试套件出结果来确定自己没有改好了这里却打破了那里。这是必要的代价,由人来做需要花更多的时间,更不用说,人的纪律性还不如ai agent。
其实之前两个agent有个任务干了48个小时还没完,只是那次我没忍住人工干预了。
不过,my-ai-team一直在进步,Explorer的宪法也在不断修订,开出这种巨型ticket的 错误它不会再犯了。
!image
这个任务两个agent (duo-dev, duo-review)跑了15个小时才完成。它本应该拆成四个相对独立的小任务的。但令我欣慰的是,虽然人类(我)给安排了不合理的巨型任务,但它们还是在无人值守的情况下连续跑了十五个小时,胜利完成任务。dev被Reviewer打回去10次,终于在第11次获批合并。16个文件变更,加2000多行代码,删1000多行。dev是 opus med, reviewer是 5.6-luna xhigh。my-ai-team 的越来越成熟可靠了。!image
Issue 评论数是一个可靠指标,如果一个票有超过10个评论,往往就说明scope有点大了。
!image
这个任务两个agent (duo-dev, duo-review)跑了15个小时才完成。它本应该拆成四个相对独立的小任务的。但令我欣慰的是,虽然人类(我)给安排了不合理的巨型任务,但它们还是在无人值守的情况下连续跑了十五个小时,胜利完成任务。dev被Reviewer打回去10次,终于在第11次获批合并。16个文件变更,加2000多行代码,删1000多行。dev是 opus med, reviewer是 5.6-luna xhigh。my-ai-team 的越来越成熟可靠了。!image
Issue 评论数是一个可靠指标,如果一个票有超过10个评论,往往就说明scope有点大了。
!image
ai能力再强,我也不会把一个巨大scope的票扔给delivery agent一个loop做完。因为那样会很慢,很贵,而且交付质量不能保证。
拆票本身有巨大的积极意义,谁和谁耦合的厉害,不能拆或者说拆前必须先解耦。谁和谁互不影响,可以并行做。拆票不必非由人来做,如果你有一个训练有素的开票员agent,你只需要敲打敲打,必要的时候提提醒,剩下的事情,细心的开票员会自动做好。
my-ai-team里开票员agent享有与人亲密聊天的特权,它的名字叫Explorer。
拆票本身有巨大的积极意义,谁和谁耦合的厉害,不能拆或者说拆前必须先解耦。谁和谁互不影响,可以并行做。拆票不必非由人来做,如果你有一个训练有素的开票员agent,你只需要敲打敲打,必要的时候提提醒,剩下的事情,细心的开票员会自动做好。
my-ai-team里开票员agent享有与人亲密聊天的特权,它的名字叫Explorer。
这是一个有魔法的时代。AI啥都知道,但需要你问对问题。魔法一直就在那里,它在等你念对咒语。而念对咒语的过程就是把需求和前置条件描述清楚的过程。
人还是需要学习,要大量的学习才能念对咒语。有幸生在AI时代,想学什么都不用请别的老师,AI就是最好的老师。
人还是需要学习,要大量的学习才能念对咒语。有幸生在AI时代,想学什么都不用请别的老师,AI就是最好的老师。