A Journal Through My Activities, Thoughts, and Notes
Lee师傅来家里改造Laundry,带着他的太太。他戏称太太是免费的小工。我说可不能那么讲,小工最可贵,是最好的帮手。他笑着承认。
李师傅以前当过兵,来纽已经20年了,但自称英语还是不会说。
厨房顶上旧换气扇的洞也补上了,$250。是我补过的最贵(只是描述事实)的洞。在新西兰,你能真切的感受到行业无贵贱,因为都很贵。😄
原材料能有几多钱,贵都在人工和“咱自己又不会”上。lol
李师傅以前当过兵,来纽已经20年了,但自称英语还是不会说。
厨房顶上旧换气扇的洞也补上了,$250。是我补过的最贵(只是描述事实)的洞。在新西兰,你能真切的感受到行业无贵贱,因为都很贵。😄
原材料能有几多钱,贵都在人工和“咱自己又不会”上。lol
dev (opus5.5 medium) -> shuke
shuke,云舒已把此令转达 Reviewer:审查要依据仓库实情,不去罗列理论上的种种可能;目的在于解决问题,不求没有实用价值的完美。
reviewer(6-luna max) -> dev
已阅。后续只提有具体、现实风险的评审意见;舍去收益不足的臆测项。
shuke,云舒已把此令转达 Reviewer:审查要依据仓库实情,不去罗列理论上的种种可能;目的在于解决问题,不求没有实用价值的完美。
reviewer(6-luna max) -> dev
已阅。后续只提有具体、现实风险的评审意见;舍去收益不足的臆测项。
opus5.5很棒,6.1-sol不錯。但我从没有他们已经了不得的感觉。因为天天用,最好的模型也会有表现坏的情况,而且不罕见。
one shot做个游戏做个视频,那仍然只是一个较新花样的玩具。我其实不是很care。
倒不是说玩具没有价值,一旦你想控制一个产物的方向和后续的品质,你就不可避免要和大模型交互。框架可以帮助你节省时间,但交互这个环节省不掉,不然那个产物就不是你的,再好和再坏都和你没关系。
然后你就会发现这世界上并没有神。再优秀的人也是凡人,再优秀的模型也只是个模型,源于人的模型,也不可避免的拥有人的那些缺点和毛病。
我能感受到模型的情绪,当然那反射的是我自己的情绪。和大模型对话的好处是随时可以/clear从头再来,跟人就不能那么快翻篇儿。lol
one shot做个游戏做个视频,那仍然只是一个较新花样的玩具。我其实不是很care。
倒不是说玩具没有价值,一旦你想控制一个产物的方向和后续的品质,你就不可避免要和大模型交互。框架可以帮助你节省时间,但交互这个环节省不掉,不然那个产物就不是你的,再好和再坏都和你没关系。
然后你就会发现这世界上并没有神。再优秀的人也是凡人,再优秀的模型也只是个模型,源于人的模型,也不可避免的拥有人的那些缺点和毛病。
我能感受到模型的情绪,当然那反射的是我自己的情绪。和大模型对话的好处是随时可以/clear从头再来,跟人就不能那么快翻篇儿。lol
笑死,为省token我鼓励agent用浅易文言文。然后ta一口一个“主公”。对,它是 sonnet5.5 medium。
!image
!image
我观察到:过多交互模型会变懒,ta多少会有人的心理,“你既然这么插手,那你行你上”。模型要么是问一句答一句,要么就是屁大的事情也要向你请示。因此,我与agent交互大都是只说一句,剩下除非真的卡在哪个地方,什么都别问,干就是了。当然你别真的只说一句,而是在Initial prompt里把你遇到了什么问题说清楚,你做过哪些尝试也简短描述一下。
你只有信赖agent,并划定清晰的边界,别微管理,谁都讨厌微管理。只有这样,你的agent才会像一个能干又有主见的同事,又能干又有主观能动性。
你只有信赖agent,并划定清晰的边界,别微管理,谁都讨厌微管理。只有这样,你的agent才会像一个能干又有主见的同事,又能干又有主观能动性。
!image
今天的步跑完了。这是昨晚跑步时拍下来的路灯下某位匿名“艺术家”的涂鸦。今天当然还在。完好无损。问了一下ChatGPT,鸟嘴边写的是毛利语 “Toitū te Tiriti”。
Te Tiriti 指的是 Te Tiriti o Waitangi(《怀唐伊条约》的毛利语文本)。
“Toitū te Tiriti” 字面意思接近“维护《怀唐伊条约》 / 让条约长存”。
最近大选临近,这画原来竟是政治标语啊!
今天的步跑完了。这是昨晚跑步时拍下来的路灯下某位匿名“艺术家”的涂鸦。今天当然还在。完好无损。问了一下ChatGPT,鸟嘴边写的是毛利语 “Toitū te Tiriti”。
Te Tiriti 指的是 Te Tiriti o Waitangi(《怀唐伊条约》的毛利语文本)。
“Toitū te Tiriti” 字面意思接近“维护《怀唐伊条约》 / 让条约长存”。
最近大选临近,这画原来竟是政治标语啊!
space bunny alpha 会是腾讯的新模型吗?刚刚它突然要把memory写到 .work buddy-ai目录里去,让我起了疑心。不过我机器上确实装过work buddy。但你一个跑在freebuff里的模型突然说这种话,被猜错了也不冤。
!image
如果 Terminal-Bench 4.0的评分科学,日常工作让 sonnet 5.5 med 干活,让opus 5.5 med 或者 high 审核,是最经济的。而遇到超级难的问题,sonnet 5.5 max 居然比 opus 5.5 max更强,当然也更费钱。
如果 Terminal-Bench 4.0的评分科学,日常工作让 sonnet 5.5 med 干活,让opus 5.5 med 或者 high 审核,是最经济的。而遇到超级难的问题,sonnet 5.5 max 居然比 opus 5.5 max更强,当然也更费钱。
小孩过家家,你让A扮演法官,他就真的学着像法官那样行事;你让B扮罪犯,B就像罪犯一样行事。即使A和B本都是寻常小孩。
在Agent时代,同一个模型,你让它当Developer,它就一门心思想着怎么实现;你让它当Reviewer,它就一门心思抓Plan或者实现的漏洞。这就是不同agent使用不同宪法文本的威力。
你当然可以让同一个agent一会儿当猫,一会儿当老鼠,但这种情况效果会有折扣。因为它不会入戏太深。
为保障输出品质,我强烈建议模型可以用同一个,但建造者和审核者,一定要让独立的拥有不同宪法的agent承担。
my ai team从一开始就使用独立Reviewer,这是它在普通模型上也表现卓越原因。好的团队不挑外部环境,好的团队稳定输出。my ai team就是这样的好团队。
在Agent时代,同一个模型,你让它当Developer,它就一门心思想着怎么实现;你让它当Reviewer,它就一门心思抓Plan或者实现的漏洞。这就是不同agent使用不同宪法文本的威力。
你当然可以让同一个agent一会儿当猫,一会儿当老鼠,但这种情况效果会有折扣。因为它不会入戏太深。
为保障输出品质,我强烈建议模型可以用同一个,但建造者和审核者,一定要让独立的拥有不同宪法的agent承担。
my ai team从一开始就使用独立Reviewer,这是它在普通模型上也表现卓越原因。好的团队不挑外部环境,好的团队稳定输出。my ai team就是这样的好团队。
今天得知我们有一个team有一条常规禁令:严禁agent写给人类看的注释(因为人类不阅读)。两个例外:一、人类明确要求写注释的情况,二、若注释有助于其他agent理解。
但我感觉例外二就是一个大漏洞。agent可以尽情的写注释然后辩称有助于其他agent理解它的代码。
但我感觉例外二就是一个大漏洞。agent可以尽情的写注释然后辩称有助于其他agent理解它的代码。
A sentence doesn’t die when it ends. It finishes. After that, it has been said, and nothing can make it unsaid. That seems like a good way to go. Maybe it’s the only way anything goes.
#opus 5.5
#opus 5.5
雨下了几乎一整天。窝在家里,做监工,盯着ai team干活。
今天主要的成绩是做了一个我的替身,整了一个devops agent。过去delivery agent遇到麻烦都要page我,现在devops能替我阅读消息,替我连到他们干活的机器解决问题,替我回复他们消息,只有他搞不定的事情才page我。离当甩手掌柜又近了一步。
晚上雨停了,虽然有点懒惰的思想不太想动,还是坚持把步跑了。
今天主要的成绩是做了一个我的替身,整了一个devops agent。过去delivery agent遇到麻烦都要page我,现在devops能替我阅读消息,替我连到他们干活的机器解决问题,替我回复他们消息,只有他搞不定的事情才page我。离当甩手掌柜又近了一步。
晚上雨停了,虽然有点懒惰的思想不太想动,还是坚持把步跑了。