「美学表现」共找到 2256 篇相关文章
Agent KB:经验池让Agents互相学习!GAIA新开源SOTA,Pass@1性能最高提升6.66
来自多家机构团队发布 Agent KB 框架,构建经验池实现 AI Agent 经验共享。在 GAIA 基准测试中表现出色,提升多模型 Pass@1 性能,还在软件工程领域展现价值。其设计精妙,经消融、检索策略等实验验证有效。
DeepRare 重磅发布:全球首个可循证智能体诊断系统,直击医学Last Exam难题
上海交通大学人工智能学院等联合发布全球首个罕见病推理型智能体诊断系统DeepRare。它结合大模型和多智能体架构,模拟医生诊断思维,支持多模态输入,在多数据集评估中表现出色,已上线在线平台。
这个国产Deep Research 有些「另类」:它不想只授你以鱼,还想授你以渔
文章介绍秘塔AI的Deep Research产品,它有“问题链”展示,研究过程可视化,免费开放。实测中它表现出色,能深度分析问题、给出有价值结论。虽有小瑕疵,但在深度研究赛道领先,让AI思考透明、研究普惠。
国产Deep Research杀出一匹「裸奔」黑马:免费开放,过程透明,网页报告一键即出
国产AI搜索秘塔AI搜索放大招,深度研究功能发布即免费公开,自带新玩法,思考过程透明。在评测集上表现优,可应对复杂问题,生成规范报告,还能转互动网页,严谨度与易用性兼备。
突发!美国解除封锁,英伟达可向中国销售H20 AI芯片
CNBC消息,美国政府向英伟达保证授予销售许可,将恢复对中国销售H20 AI芯片。此前该芯片受出口管制。黄仁勋加大游说,与特朗普会面后美态度转变,他还宣布新GPU,英伟达财报表现强劲。
Meta-Think ≠ 记套路,多智能体强化学习解锁大模型元思考泛化
上海交通大学等团队提出ReMA框架,将复杂推理解耦为元思维和推理智能体,通过迭代强化学习协作。在单轮实验中,ReMA在多基准测试表现优;多轮实验虽有提升但不稳定,需进一步探索。
差点被Ilya摁掉,胎死腹中!ChatGPT爆红内幕首次公开
本文深度揭秘ChatGPT爆红内幕,从产品发布、命名内幕到团队文化等方面展开。还提及OpenAI内部对发布的争议,以及ChatGPT发布方式的转变,同时指出依赖用户反馈改进模型存在的问题和OpenAI看重的人才特质。
一天 15k 星,代码生成碾压 Claude,连 Cursor 都慌了?谷歌 Gemini CLI 杀疯了
谷歌发布 Gemini CLI,有慷慨免费使用配额,开源且不到一天获 15.1k 星。它连接 MCP 服务器,具备 Agentic AI 能力,接入 Gemini 2.5 Pro 模型,在代码生成等方面表现出色,谷歌认为通用模型更优。
生成式视角重塑监督学习!标签不只是答案,更是学习指南 | ICML 2025
上海交大等机构团队在ICML 2025提出预测一致性学习(PCL),通过扩散过程消减标签信息,引入噪声标签,将标签学习分解为渐进式任务,实现标签信息复用。在多模态任务实验中,PCL表现优于传统监督学习。
英伟达笑到最后!训练2000步,1.5B逆袭7B巨兽,Scaling真来了
英伟达团队提出ProRL训练法,将强化学习扩展到超2000步。用此方法训练的15亿参数模型媲美70亿参数的Deepseek - R1 - 7B,在多任务中表现出色,解决了熵崩溃和训练不稳定问题。