「超并行实验」共找到 3431 篇相关文章
端到端GUI智能体首次实现“犯错-反思-修正”闭环,模拟人类认知全过程
南洋理工大学MMLab团队提出框架GUI - Reflection,让端到端多模态GUI智能体有“自我反思”能力。它在各训练阶段引入“反思与纠错”机制,实验证明该框架能提升智能体能力。
不愁了!开源智能体Paper2Poster「一键生成」学术海报
2025年5月,滑铁卢大学等团队发布Paper2Poster系统,用大模型将论文自动生海报。它提出PosterAgent多智能体方法,分解析、规划、绘制优化三阶段,生成效果好且开源,不过也存在效率和创意不足问题。
人类打辩论不如GPT-4?!Nature子刊:900人实战演练,AI胜率64.4%,还更会说服人
瑞士洛桑联邦理工学院等机构研究人员让900名美国参与者与人类或GPT - 4就社会议题辩论。发现GPT - 4知晓对手信息时胜率64.4%,说服效果提升81.2%,低/中争议话题更易受其影响。
Google | 溯源分析RAG系统错误,提出选择性生成框架,让RAG问答准确率提升10%
Google对RAG系统错误深入分析,引入‘充分上下文’概念,指出幻觉或因上下文不足。构建评估器,提出选择性生成框架,结合多信号决策,实验显示可让RAG问答准确率最高提升10%。
用AI把一段视频变成可视化网页,Google的新模型又卷飞了。
Google将Gemini 2.5 Pro更新为05 - 06版,此版代码能力在WebDev Arena盲测竞技场登顶,还提升视频理解能力,可将视频变成可视化网页,虽产品有不足,但模型进步值得肯定。
实战指南:从零构建 MCP 架构下的 Agentic RAG 系统,无第三方MCP Server
五一期间作者用MCP架构从零实现Agentic RAG系统,分享MCP与Agentic RAG融合思考、架构设计,介绍MCP服务端和客户端实现,还做了端到端效果演示,指出架构优势及待优化处。
云知声发布U2-Flash,要争“大模型主力位”|甲子光年
本文报道云知声发布U2-Flash大模型,基于原有U2基座,通过创新后训练方案提升Coding、Agent等复杂任务能力,多项评测比肩头部模型,目标成为企业真实生产任务的主力大模型。
『书生·端砚』全面开放全栈服务,“算、证、验”三合一,筑牢科学智能底座 | 2026浦江创新论坛
上海人工智能实验室在2026第十九届浦江创新论坛上,升级发布书生·端砚科学发现平台并全面开放全栈服务,升级三大核心能力,覆盖完整科研流程,已落地六大核心科研领域,开放给科研人员试用。
Codex正式开放1M上下文!解除GPT-5.6 Sol封印,三行配置搞定
现在3行配置就能让GPT - 5.6 Sol封印解除,在Codex里用上1M上下文。不过有网友警告轻易别用,因超出默认窗口,模型消耗token速度会翻倍,且模型上下文利用能力会下降。此外,Codex确定会上Astra。
北大联合阶跃星辰提出TensorCast:统一可编程管理大模型张量,推理「首字延迟」最高降低93.2%
随着模型规模增长、新应用兴起,大模型基础设施面临管理「张量状态」挑战。北大、阶跃星辰与北邮联合提出 TensorCast,解耦张量状态,复用管理能力,在多场景测试中表现出色,为大模型基建提供新范式。