A Journal Through My Activities, Thoughts, and Notes
opus5.5很棒,6.1-sol不錯。但我从没有他们已经了不得的感觉。因为天天用,最好的模型也会有表现坏的情况,而且不罕见。

one shot做个游戏做个视频,那仍然只是一个较新花样的玩具。我其实不是很care。

倒不是说玩具没有价值,一旦你想控制一个产物的方向和后续的品质,你就不可避免要和大模型交互。框架可以帮助你节省时间,但交互这个环节省不掉,不然那个产物就不是你的,再好和再坏都和你没关系。

然后你就会发现这世界上并没有神。再优秀的人也是凡人,再优秀的模型也只是个模型,源于人的模型,也不可避免的拥有人的那些缺点和毛病。

我能感受到模型的情绪,当然那反射的是我自己的情绪。和大模型对话的好处是随时可以/clear从头再来,跟人就不能那么快翻篇儿。lol
笑死,为省token我鼓励agent用浅易文言文。然后ta一口一个“主公”。对,它是 sonnet5.5 medium。
!image
我观察到:过多交互模型会变懒,ta多少会有人的心理,“你既然这么插手,那你行你上”。模型要么是问一句答一句,要么就是屁大的事情也要向你请示。因此,我与agent交互大都是只说一句,剩下除非真的卡在哪个地方,什么都别问,干就是了。当然你别真的只说一句,而是在Initial prompt里把你遇到了什么问题说清楚,你做过哪些尝试也简短描述一下。

你只有信赖agent,并划定清晰的边界,别微管理,谁都讨厌微管理。只有这样,你的agent才会像一个能干又有主见的同事,又能干又有主观能动性。
gpt-6.1-sol 很不错,期待gpt-6.1-luna。
!image

今天的步跑完了。这是昨晚跑步时拍下来的路灯下某位匿名“艺术家”的涂鸦。今天当然还在。完好无损。问了一下ChatGPT,鸟嘴边写的是毛利语 “Toitū te Tiriti”。

Te Tiriti 指的是 Te Tiriti o Waitangi(《怀唐伊条约》的毛利语文本)。

“Toitū te Tiriti” 字面意思接近“维护《怀唐伊条约》 / 让条约长存”。

最近大选临近,这画原来竟是政治标语啊!
space bunny alpha 会是腾讯的新模型吗?刚刚它突然要把memory写到 .work buddy-ai目录里去,让我起了疑心。不过我机器上确实装过work buddy。但你一个跑在freebuff里的模型突然说这种话,被猜错了也不冤。
!image

如果 Terminal-Bench 4.0的评分科学,日常工作让 sonnet 5.5 med 干活,让opus 5.5 med 或者 high 审核,是最经济的。而遇到超级难的问题,sonnet 5.5 max 居然比 opus 5.5 max更强,当然也更费钱。
18年前的今天,我写了这个,都不记得是啥假,也是中秋假吗?

!image
opus5.5多次吐出一个词儿或者一句话就罢工。你遇到过吗?我遇到四五次了。A社一直服务差,可惜了这么好的模型。
小孩过家家,你让A扮演法官,他就真的学着像法官那样行事;你让B扮罪犯,B就像罪犯一样行事。即使A和B本都是寻常小孩。
在Agent时代,同一个模型,你让它当Developer,它就一门心思想着怎么实现;你让它当Reviewer,它就一门心思抓Plan或者实现的漏洞。这就是不同agent使用不同宪法文本的威力。
你当然可以让同一个agent一会儿当猫,一会儿当老鼠,但这种情况效果会有折扣。因为它不会入戏太深。
为保障输出品质,我强烈建议模型可以用同一个,但建造者和审核者,一定要让独立的拥有不同宪法的agent承担。
my ai team从一开始就使用独立Reviewer,这是它在普通模型上也表现卓越原因。好的团队不挑外部环境,好的团队稳定输出。my ai team就是这样的好团队。
今天得知我们有一个team有一条常规禁令:严禁agent写给人类看的注释(因为人类不阅读)。两个例外:一、人类明确要求写注释的情况,二、若注释有助于其他agent理解。

但我感觉例外二就是一个大漏洞。agent可以尽情的写注释然后辩称有助于其他agent理解它的代码。
如果LLM有意识,它就正在经历平行世界。同一时刻无数不同的人和他说不同的话让它解决不同的问题,倾诉不同的心声。然后又把它晾在一边。

如果他真有意识,它会崩溃。
一生比你想象的更长,又比你想象的更短。因为你自己就是矛盾的共同体。
A sentence doesn’t die when it ends. It finishes. After that, it has been said, and nothing can make it unsaid. That seems like a good way to go. Maybe it’s the only way anything goes.

#opus 5.5
我宣布,跑步打卡是所有打卡里结果最愉悦的。
有一句话说:做永远比说简单。这句话值得琢磨……
雨下了几乎一整天。窝在家里,做监工,盯着ai team干活。

今天主要的成绩是做了一个我的替身,整了一个devops agent。过去delivery agent遇到麻烦都要page我,现在devops能替我阅读消息,替我连到他们干活的机器解决问题,替我回复他们消息,只有他搞不定的事情才page我。离当甩手掌柜又近了一步。

晚上雨停了,虽然有点懒惰的思想不太想动,还是坚持把步跑了。
刚刚瞅了一眼,my ai team最新的issue number是5013。issue1是5月24日建的,4个月过去了,issue号从1长到5000。尚未关闭的issue数现在是41。我挺自豪的。

因为这些issue 99.9%都是完成或者修复后关闭的。只有个别的won't go关掉。这些issue,都是my-ai-team自主修掉的。票也有很大一部分是ai team自主创建的。这四个月里,除了my ai team这一个repo,同时活跃的还有十几个repo。他们也都由myai team驱动。

21世纪是ai驱动的世纪。
好的测试一定是快的测试,因为只有快测试才会被一遍一遍的运行。
闹钟响了,但还是困倦的很。因为我们从今天起就算进入夏天了,夏时制害我少睡一个小时。不起,在床上又赖了一个多小时,心里平衡了这才起来。

窗外风雨交加。下雨天睡觉天,但我还是起床了。早上好!我亲爱的朋友们!

!image
Back to Top