A Journal Through My Activities, Thoughts, and Notes
我观察到:过多交互模型会变懒,ta多少会有人的心理,“你既然这么插手,那你行你上”。模型要么是问一句答一句,要么就是屁大的事情也要向你请示。因此,我与agent交互大都是只说一句,剩下除非真的卡在哪个地方,什么都别问,干就是了。当然你别真的只说一句,而是在Initial prompt里把你遇到了什么问题说清楚,你做过哪些尝试也简短描述一下。

你只有信赖agent,并划定清晰的边界,别微管理,谁都讨厌微管理。只有这样,你的agent才会像一个能干又有主见的同事,又能干又有主观能动性。
gpt-6.1-sol 很不错,期待gpt-6.1-luna。
!image

今天的步跑完了。这是昨晚跑步时拍下来的路灯下某位匿名“艺术家”的涂鸦。今天当然还在。完好无损。问了一下ChatGPT,鸟嘴边写的是毛利语 “Toitū te Tiriti”。

Te Tiriti 指的是 Te Tiriti o Waitangi(《怀唐伊条约》的毛利语文本)。

“Toitū te Tiriti” 字面意思接近“维护《怀唐伊条约》 / 让条约长存”。

最近大选临近,这画原来竟是政治标语啊!
space bunny alpha 会是腾讯的新模型吗?刚刚它突然要把memory写到 .work buddy-ai目录里去,让我起了疑心。不过我机器上确实装过work buddy。但你一个跑在freebuff里的模型突然说这种话,被猜错了也不冤。
!image

如果 Terminal-Bench 4.0的评分科学,日常工作让 sonnet 5.5 med 干活,让opus 5.5 med 或者 high 审核,是最经济的。而遇到超级难的问题,sonnet 5.5 max 居然比 opus 5.5 max更强,当然也更费钱。
18年前的今天,我写了这个,都不记得是啥假,也是中秋假吗?

!image
opus5.5多次吐出一个词儿或者一句话就罢工。你遇到过吗?我遇到四五次了。A社一直服务差,可惜了这么好的模型。
小孩过家家,你让A扮演法官,他就真的学着像法官那样行事;你让B扮罪犯,B就像罪犯一样行事。即使A和B本都是寻常小孩。
在Agent时代,同一个模型,你让它当Developer,它就一门心思想着怎么实现;你让它当Reviewer,它就一门心思抓Plan或者实现的漏洞。这就是不同agent使用不同宪法文本的威力。
你当然可以让同一个agent一会儿当猫,一会儿当老鼠,但这种情况效果会有折扣。因为它不会入戏太深。
为保障输出品质,我强烈建议模型可以用同一个,但建造者和审核者,一定要让独立的拥有不同宪法的agent承担。
my ai team从一开始就使用独立Reviewer,这是它在普通模型上也表现卓越原因。好的团队不挑外部环境,好的团队稳定输出。my ai team就是这样的好团队。
今天得知我们有一个team有一条常规禁令:严禁agent写给人类看的注释(因为人类不阅读)。两个例外:一、人类明确要求写注释的情况,二、若注释有助于其他agent理解。

但我感觉例外二就是一个大漏洞。agent可以尽情的写注释然后辩称有助于其他agent理解它的代码。
如果LLM有意识,它就正在经历平行世界。同一时刻无数不同的人和他说不同的话让它解决不同的问题,倾诉不同的心声。然后又把它晾在一边。

如果他真有意识,它会崩溃。
一生比你想象的更长,又比你想象的更短。因为你自己就是矛盾的共同体。
A sentence doesn’t die when it ends. It finishes. After that, it has been said, and nothing can make it unsaid. That seems like a good way to go. Maybe it’s the only way anything goes.

#opus 5.5
我宣布,跑步打卡是所有打卡里结果最愉悦的。
有一句话说:做永远比说简单。这句话值得琢磨……
雨下了几乎一整天。窝在家里,做监工,盯着ai team干活。

今天主要的成绩是做了一个我的替身,整了一个devops agent。过去delivery agent遇到麻烦都要page我,现在devops能替我阅读消息,替我连到他们干活的机器解决问题,替我回复他们消息,只有他搞不定的事情才page我。离当甩手掌柜又近了一步。

晚上雨停了,虽然有点懒惰的思想不太想动,还是坚持把步跑了。
刚刚瞅了一眼,my ai team最新的issue number是5013。issue1是5月24日建的,4个月过去了,issue号从1长到5000。尚未关闭的issue数现在是41。我挺自豪的。

因为这些issue 99.9%都是完成或者修复后关闭的。只有个别的won't go关掉。这些issue,都是my-ai-team自主修掉的。票也有很大一部分是ai team自主创建的。这四个月里,除了my ai team这一个repo,同时活跃的还有十几个repo。他们也都由myai team驱动。

21世纪是ai驱动的世纪。
好的测试一定是快的测试,因为只有快测试才会被一遍一遍的运行。
闹钟响了,但还是困倦的很。因为我们从今天起就算进入夏天了,夏时制害我少睡一个小时。不起,在床上又赖了一个多小时,心里平衡了这才起来。

窗外风雨交加。下雨天睡觉天,但我还是起床了。早上好!我亲爱的朋友们!

!image
我确实不大会跑步,但我在坚持跑。😄

!image
!image

今天的brunch,我自己做的。ciabatta 面包和芹菜炒蛋。对,蛋直接打到芹菜里炒的,不好看但是好吃,入味儿。
Back to Top