「多智能体协同编程」共找到 4285 篇相关文章
AI在「赚钱锦标赛」夺冠,比人类还会做生意!躺赚时代要来了?
研究人员提出自动售货机运营模拟环境Vending - Bench,测试大模型智能体管理业务能力。实验显示不同大模型性能方差大,Claude 3.5 Sonnet净资产表现最佳,人类基线在可靠性上表现较好,各模型长周期表现波动大。
仅隔一天,OpenAI同步上线o3和o4 mini,它们能调用ChatGPT里的多种工具,可基于图像思考。o3是强大推理模型,o4-mini专为快速经济推理优化。即日起部分会员可体验,还开源了Codex CLI。
全球唯一非侵入穿颅读脑突破!这家中国公司想成为脑科学的“英伟达”
当前脑机接口领域,侵入式危险、非侵入式分辨率低,深圳鲲为公司另辟蹊径,基于声学空间智能理论,用低频超声+算力算法实现全球首个非侵入高分辨率穿颅读脑,已商业化落地,目标成为脑科学领域的"英伟达"。
全网实测开玩Fable 5.1,听说写作说话和真人没区别?
Anthropic发布Fable 5.1后,第三方跑分和个人实测出炉。ARC Prize测试成绩佳且成本降32%,网友用它做出多款游戏。科技媒体Every全面测评,指出其多方面优势与设计等短板,并给出使用边界。
港科大(广州)联合腾讯AI平台部开源VibeWorlding,3D世界构建迎来Vibe Coding时刻?
香港科技大学(广州)联合腾讯AI平台部提出VibeWorlding,是可通过多轮对话等自主构建和编辑交互式3D世界的多模态智能体框架。团队开源多项数据,其模型经强化学习后表现超GPT - 5.5等。
OpenAI和Anthropic费尽心机加密的思维链,竟然能被轻松提取?
围绕大模型蒸馏争议已久,此前外部团队难获闭源模型完整推理。8 月 10 日研究者公开方法,可让弱模型读取旗舰模型密文并输出推理,还发现公开智能体轨迹存在隐私泄露问题,不过未为蒸馏指控提供决定性证据。
Claude Sonnet 5 上线一日差评刷屏:打不过千问和 Minimax,性价比全面翻车
Claude Sonnet 5发布一天差评多。虽官方定位高,有能力亮点,但在中文测评中性价比低,测试成本高,且Max推理模式易过度思考。还因过度保守失去实用价值,其表现取决于使用场景和预算。
米哈游一夜烧掉200万元Token,大厂高管也开始质疑:Token烧不出价值,但养肥了谁?
Uber运营负责人质疑AI tokenmaxxing成本合理性,米哈游员工一晚烧200万Token。部分公司开始调整,如多邻国取消AI使用绩效评估,Shopify阻止失控消耗。Tokenmaxxing让模型厂商、编程工具和算力相关方受益,盲目跟风企业或成输家。
2026年了,我们还在用爱迪生试灯丝的方式评估World Model
文章围绕World model展开深度讨论,界定其概念,分析生成派、JEPA派、空间智能派三条技术路线,指出评估比LLM难,提及游戏化benchmark可能是破局点,还强调具身进展由数据驱动,Ego - View或为泛化关键。
写了 17 年开源代码,我为什么认为 Coding Agents 堆功能是在瞎折腾?
libGDX 创始人、17 年开源老兵 Mario Zechner 吐槽 Claude Code、OpenCode 等工具功能堆叠,带来掌控感丧失等问题。他推出极简主义编程 agent pi,仅含四种工具,有最短系统提示词,扩展性强,能让开发者重拾掌控权。