研究型智能体」共找到 5095 篇相关文章

开源动态8

开源Agent新标杆:通义WebSailor多榜夺魁,挑战OpenAI高难度Agent基准BrowseComp

信息爆炸时代,传统搜索引擎难满足需求,开源Web Agent在极端复杂任务表现不佳。阿里巴巴通义实验室推出WebSailor,通过创新数据构造和训练方法,在BrowseComp等挑战上取得突破,缩小与顶级封闭系统差距。

机器之心
产品应用8

推出4个月就狂赚3亿?!百万用户应用CTO弃Copilot转Claude Code:200美元拯救我的137个应用

Anthropic 公司推出的 AI 编码助手 Claude Code 推出 4 个月吸引 11.5 万开发者,单周处理 1.95 亿行代码,年化收入预估达 1.3 亿美元。开发者认为它优势明显,Soham 级别的生产力,还分享使用技巧。

AI前线
算法论文8

关键突破:理论验证了 RL for LLM 路线的可行性

传统RLHF依赖人工标注偏好数据训练奖励模,成本高且难扩展。本文发现任何通过Next - token预测训练的LLM内部隐含通用奖励模,从理论和实验证明其可高效实现模对齐。

深度学习自然语言处理
新闻资讯7

更长的推理链反而导致更多幻觉,MLLMs 幻觉解法仅「抄作业」还不够?摘要

近日,斯坦福等校学者发现,更长推理链会让 MLLMs 产生更强幻觉。MLLMs 幻觉不仅涉及语言偏差,还有跨模态语义失配。主流多模态架构在结构设计和训练机制上的潜在失衡,是幻觉频发的主因。

机器之心
新闻资讯7

OpenAI 4 名王牌研究员“叛变”,Meta 上亿美元的签约奖金终于花出去了

近日,Meta 招募 4 名前 OpenAI 研究员加入超级智能实验室。招聘背景是其 Llama 4 Behemoth 模有性能问题。Meta 还以高额奖金挖角,且不局限于 OpenAI,还投入巨资支持 AI 项目。

AI前线
推荐文章7

开发者不仅编写代码,也在创造世界

智能GitHub Copilot副驾驶等生成式AI技术出现,使编程从“指令式”转向“意图式”。开发者需具备对问题、模、交互的新“品味”,微软相关工具顺应此趋势,峰会将探讨相关话题。

AIGC开放社区
算法论文8

推理正确率下降65.5%!斯坦福、MIT等用「不等式」拷问AI逻辑极限

大语言模在数学证明常现推理漏洞,斯坦福等高校团队提出IneqMath基准评估其严谨性。用不等式证明题切入,拆解为子任务,构建评测体系,用LLM - as - Judge审查。结果显示模推理正确率低,存在结构性缺陷。

新智元
新闻资讯7

市场还没爆发,但AI眼镜已经卷死了

今年5月多款AI眼镜新品上线,市场竞争激烈。硬件上芯片向高端手机靠拢,软件借AI大模落地功能,还出现代工产业链。不过,国内AI眼镜在AI和软件功能上有不足,与市场需再磨合。

芯师爷
产品应用7

高考第一天,用豆包修图3.0花式「整活」送祝福,已原地笑翻!

豆包的一句话P图功能进化,其图像编辑模SeedEdit 3.0全量上线,AI修图进入3.0时代。用自然语言就能精准编辑图片,在文字编辑、局部修改等方面表现出色,还突破以往模瓶颈,成设计师利器。

新智元
推荐文章8

OpenAI 早期董事会成员:算法与神经网络成“超能架构”,我们如何自处?|文末赠书

OpenAI 早期投资人里德·霍夫曼新书《AI 赋能》中文版推出。书中提出 AI 应是放大人类行动力的工具,还阐述“超级能动性”概念,强调技术与人类深度共生,批判盲目创新,主张技术锚定人文价值。

AI前线