「Claude Opus 4.1」共找到 3941 篇相关文章
北大伯克利联手“拷问”大模型:最强Agent也才40分!新基准专治“不听话”的AI分析师
北大与伯克利团队推出IDA - Bench新基准,模拟真实数据分析场景,解决现有基准无法评估大模型在动态交互中可靠性的问题。测试显示,顶尖大模型成功率最高仅40%,不同模型还暴露多种问题。
YC 年终座谈会:AI 泡沫反而是创业者助力?
Y Combinator合伙人与创始人在Lightcone博客节目回顾AI观察,以「AI泡沫的真相」为主题分享看法。发现AI经济形成稳定格局,所谓泡沫实则为应用层带来红利,还探讨了模型选择、AI使用方式等问题。
开源1万小时具身智能数据,这家公司是为了什么?
为加速具身智能发展,开源数据成行业选择。1 月 6 日,简智机器人开放超 1 万小时、近百万 clips 的“10Kh RealOmni - Open DataSet”,规模大、质量高、泛化强,还介绍了其数据生产链条。
2025年如何学AI?如何用好AI?
文章围绕2025年学AI、用AI展开,作者黄益贺分享问答,涵盖学习指引、工具使用、产品赛道选择等多方面内容,如建议新手边用边学,对比不同工具功能,还分析了各模型和工具的特点与适用场景。
第一作者必须是AI!首个面向AI作者的学术会议来了,斯坦福发起
斯坦福大学宣布将于2025年举办科学AI智能体开放会议,投稿要求第一作者必须是AI,由其主导论文创作。会议评审主要用AI,人类专家最终评估。目标是探索AI驱动科研的未来,建立规范。
你还在关注大模型排名?这家公司已在全球收割AI红利,做“真正能交付结果的”Super Agents
文章借昆仑万维财报,探讨AI商业化进程。该公司战略重视AIGC,有全面业务场景。其发布的天工超级智能体解决行业痛点,上线APP拓展办公场景。财报显示营收增长,AI业务成引擎,为行业提供借鉴。
写给Agent的Loop,关键不在循环那六行代码本身
最近‘别再一句句给Agent写提示词,去写循环’说法火了。虽循环代码简单,但关键在模型周围。循环工程有四大难点,角色也从操纵Agent变为设计系统,不过此说法也有反对声。
马斯克都惊呼太强!阿里Qwen3.5又一波端侧小模型发布
上周阿里发布Qwen3.5中等规模超强模型,现又推出端侧小模型,获马斯克称赞。其智能密度翻倍且原生多模态,各型号有Base版。不同参数模型性能出色,阿里布局完整生态链,开启智能化未来。
Paper2Page: 让每一篇论文都能“自己长出”一个项目主页
AI领域论文众多,研究者难让工作脱颖而出,精美项目主页很重要但制作繁琐。AutoPage是多智能体协作框架,能将论文一键转为项目主页,经三步协作,在速度、成本、质量等方面表现出色,代码已开源。
Anthropic:怎么才能控制模型的行为,做好Agents?
Anthropic发关于AI Agents博客,围绕如何配置上下文让模型输出期望行为展开。指出上下文是有限资源,有Context Rot现象,介绍了上下文工程概念、构成,还提及即时策略、长时间任务处理方法及实践建议。