「人类表达荒芜」共找到 1284 篇相关文章
AI 怎么自我改进?Lilian Weng 的答案是:先写好Harness
提出 Agent 基本公式的 Lilian Weng 探讨 AI 递归自我改进,强调‘harness’重要性,介绍其设计模式、优化方法,还提及未来挑战与有用基准。如 harness 工程额外包含工作流设计等,优化方式多样但也面临评估器弱等问题。
Agent不会搞科研?人大微软开源框架&工具包解决盲目试错通病,抱抱脸日榜第一
AI智能体虽能完成多项任务,但大多难以自主科研,易陷入盲目试错。人大和微软研究者提出Arbor框架与工具包,借助Hypothesis - Tree对优化空间结构化探索,多方面表现出色,荣登Huggingface日榜第一。
Sam Altman在旧金山的豪宅刚刚被炸了,嫌犯还想烧掉OpenAI总部
当地时间2026年4月10日凌晨,OpenAI CEO Sam Altman旧金山豪宅遭汽油燃烧弹袭击,一小时后嫌犯又到OpenAI总部叫嚣。嫌犯被捕,Altman罕见公开家人合影表达对家人的爱,行业抗议威胁事件增加。
张雪机车燃爆封神!国产2B语音模型重磅开源,全网听完都起鸡皮疙瘩
面壁智能联合多方开发的2B小模型VoxCPM 2于4月开源,支持30种语言与9大方言,能实现声音克隆、情绪控制、音色设计等功能。实测显示其能力出色,还提供全家桶级工具箱,采用独特技术路线。
澳洲大神用ChatGPT手搓疫苗抢命,救活癌症晚期爱犬!OpenAI总裁爆赞
澳洲AI大牛Paul Conyngham无生物学背景,用ChatGPT+AlphaFold为患癌爱犬设计全球首支定制mRNA疫苗,数周肿瘤缩小50%,引发全网关注,OpenAI总裁等盛赞,或推动人类癌症治疗。
刚刚,Anthropic深夜血洗500亿美金行业!代码审计末日来了
Anthropic的Claude Code新增代码评审功能,挑战500亿美元的传统代码审计行业。新工具成本低,能自动化评审,减少误报,准确率超多数人类评审员,或引发行业大洗牌。
对话 Elys 创始人:他的 10 个产品洞察,和他想创造的下一代社交网络
极客公园与 Elys 创始人 Tristan 深度对话,分享 10 个产品洞察。他认为 context 价值大,做新 AI 产品要找好形态,记忆系统本质是推荐系统,还阐述了对 AI 社交等看法,目标是创造低熵社交网络。
今天,被GLM-5的Agentic Coding能力惊艳到了
上月底Anthropic报告揭示编程趋势转变,月初Claude Opus 4.6与GPT - 5.3 Codex发布印证。作者深度测试GLM - 5,经两项实测挑战,发现其在复杂系统任务表现超预期,有‘系统架构师’思维。
西湖大学科研版NanoBanana开源!科研绘图从此自动化
西湖大学将科研版NanoBanana开源,其AutoFigure框架可自动化生成学术插图且能编辑,论文被ICLR 2026接收。该框架提出理性渲染范式,配套FigureBench基准测试集,表现超越人类预期。
AgentIF-OneDay 发布,评估全场景长时复杂任务
红杉中国 xbench 发布 AgentIF - OneDay 评测体系,用于评估大模型解决复杂任务的能力。该体系从任务复杂度新视角出发,沿 Scaling Context 和 Scaling Domain 推进,构造了三类典型任务进行测评,揭示了主流 Agent 的能力边界。