「Coding测试」共找到 2568 篇相关文章
不再止步于自然语言!PhiZero让世界模型学会「物理语言」
PhiZero由中科院自动化所团队研发,探索让AI读懂真实世界运动、交互与变化的“物理语言”。它构建Reason - then - Render框架,经大量数据训练,在多基准测试中表现领先,为AI理解物理世界开辟新通道。
北大联合阶跃星辰提出TensorCast:统一可编程管理大模型张量,推理「首字延迟」最高降低93.2%
随着模型规模增长、新应用兴起,大模型基础设施面临管理「张量状态」挑战。北大、阶跃星辰与北邮联合提出 TensorCast,解耦张量状态,复用管理能力,在多场景测试中表现出色,为大模型基建提供新范式。
AutoResearch-LLM:让 Agent 接手 LLM 训练优化
本文是 LLM 微调 AutoResearch 落地实战。作者将电商场景 Qwen3 微调流水线沉淀成 Agent 驱动的三阶段框架,还分享踩坑经验。思路方法与平台无关,可类比到外部环境,适合关注 AI Coding 等的同学。
人大和微软开源Arbor,一棵假设树突破自主科研新高度
中国人民大学和微软研究者推出Arbor,它将实验挂到假设树,让研究信息跨周期保留。在六道真实研究任务中表现优异,增益超Codex和Claude Code,且成本相当,还能从失败中积累经验。
Claude写80%代码,Anthropic工程师却越来越孤独
Anthropic工程负责人Fiona Fung带领团队用Claude Code使人均代码量翻8倍,但工程师交流减少,孤独感渐生。此外,还存在上下文切换、心流体验变淡、工作意义减弱等问题,工程师职业边界也在变模糊。
今天,Claude入职了!
Anthropic官宣Claude Tag,这是团队协作用Claude的全新方式,像“AI同事”般出现在Slack会话栏,响应主动,完成65%代码编写。它是Claude Code升级版,与前两代AI交互方式不同,Anthropic已离不开它。
大模型也需要睡觉!让AI打个盹,醒来更聪明
卡内基梅隆大学和马里兰大学研究发现,大模型处理长上下文易累傻。受人脑机制启发,设计睡眠机制,让模型在上下文窗口快满时打盹,反复咀嚼信息,压缩进长期权重。测试显示,增加“睡眠”轮次能提升深度推理表现。
谷歌搜不到的80%互联网,AnySearch全打通了!开发者连夜接入
2026年5月11日海外上线的AnySearch,定位AI时代「搜索基础设施」,专为AI Agent打造统一高质量搜索入口。上线一周在海外开发者圈爆火,经测试性能优于同类产品。通过不同场景实战,展现聚合广度、专业深度等四层能力。
AI学会梦里干活!Claude发布3大进化,Dario:单人公司10亿美金爆发
在 Code with Claude 大会上,Anthropic 为 Claude Managed Agents 上线三项功能。‘做梦’解决记忆退化,成果评估自动检查工作,多 Agent 协作让复杂任务分工处理。Dario 称 AI 时代单人公司或达 10 亿美金营收。
DeepSeek视觉原语论文:当所有人在堆图像分辨率时,它在堆「指代精度」!
4月30日DeepSeek发布多模态论文,核心是“视觉原语”,让模型边推理边输出坐标。它是七大coding agent玩家中最后接入视觉的,但补课方式反共识,不堆分辨率堆指代精度,效率高,拓扑推理成绩领先。