返回主页
文章
记录技术探索与思考
Step 5 Preview:一鸣惊人
基本情况
GPT-6 Astra 深度分析:它真的达到 AGI 了吗?
GPT-6 Astra 在综合榜和 General 榜位居第一,但榜单领先是否足以证明 AGI 已经到来?本文结合官方材料、系统卡、独立测评与酥悠沫榜单,拆解它的真实上限和短板。
OpenClaw从发布到2月9日,它的最新记忆系统是怎么样的
OpenClaw 的 Agent 记忆系统采用"Markdown 为真相源、SQLite为派生索引"的双层存储架构。记忆以人类可读的 Markdown 文件持久化(MEMORY.md +memory/*.md),SQLite 数据库承载 FTS5 全文索引和 sqlite-vec向量索引,支持随时从源文件重建。检...
姚顺雨混元第一篇论文《CL-bench》上下文学习评测
一、论文核心摘要
anthropic的cowork类似的开源项目介绍
思考:anthropic总是能想出新的东西,比之前openai出智能体商店啥的强多了。从mcp到claude code到skill,再到cowork。因为cowork是闭源的,然后现在AI开发很强了,开源开发者一下就跟进了开源的cowork项目,ai办公助手,像豆包电脑端,还是得上传文件,然后没有特别针对办公场景...
Anthropic的《Demystifying evals for AI agents》Agent评估详解
该文章由anthropic在1月9日发布,应该是anthropic第一篇系统讲agent评估的。原文链接可以翻到最底下。
关于Agent评估,我的一些思考
写在前面,2025年被称为”AI Agent之年”。当越来越多的Agent从实验室走向生产环境,如何科学地评估它们的能力,成了一个绑不开的话题。