「大模型开发」共找到 10170 篇相关文章

算法论文8

「听觉」引导「视觉」,OmniAgent开启全模态主动感知新范式

针对端到端全模态大模型痛点,浙江大学、西湖大学、蚂蚁集团联合提出 OmniAgent,它基于「音频引导」,用「思考 - 行动 - 观察 - 反思」闭环实现范式转变,在多基准测试中超越开闭源模型。

机器之心
新闻资讯7

多个编码智能体同时使用会不会混乱?海外开发者热议

AI编程工具进步快,GPT - 5等模型推动开发自动化。编码智能体成开发常态,但存在问题。独立开源开发者Simon Willison分享并行使用多个编码智能体经验,引发海外开发者热议。

机器之心
新闻资讯8

Anthropic 深夜祭出 Claude Sonnet 4.5,能自主连续工作 30 小时!CEO:它更像你的同事

昨夜凌晨,Anthropic 推出新一代模型 Claude Sonnet 4.5,官方称其是世界上最好的编码模型等。它能自主连续工作 30 小时,还同步推出多项产品功能更新及 Claude Agent SDK 开发工具包。

AI前线
算法论文8

OmniHuman-1.5:让数字人拥有“思考”的视频生成新范式

现有视频数字人模型难捕捉角色本质,字节提出 OmniHuman - 1.5 框架。其核心创新是用 MLLM 提供语义引导、提出多模态 DiT 架构和伪末帧设计,使模型融合多模态信号,生成高质量角色动画。

带你学AI
产品应用8

首创双NPU架构一鸣惊人!联发科天玑9500重磅加码主动式AI体验

联发科天玑9500首创超性能+超能效双NPU架构,让AI始终在线,融入用户操作。其输出性能、上下文窗口等有显著提升,还解决了模型加载慢等问题,与多厂商合作推动端侧AI落地。

量子位
开源动态8

紫东太初开源视觉神经增强方法,即插即用终结多模态幻觉 | ACL 2025

中科院自动化所等团队提出VHR方案,通过“视觉神经增强”机制放大模型视觉关键注意力头输出,降低幻觉现象。此前主流方法多作用于最终输出阶段,VHR深入干预内部机制,还介绍了SSL语义引导方法。

量子位
产品应用7

腾讯 Hy3 一手实测,Agent 能力提升不止一点

作者拿到 Hy3 模型测试资格,介绍其架构、性能和价格优势,还在 WorkBuddy 里实测它完成运营工作、选编辑助教、开发新功能等任务的效果,最后评价 Hy3 能力、价格、适配方面的表现,并分析 WorkBuddy 领先原因。

特工宇宙
推荐文章8

谁在赚钱,谁爱花钱,谁是草台班子,2025 年度最全面的 AI 报告

Nathan Benaich发布《State of AI Report(2025)》,如AI全景地图,覆盖研究、行业等领域。2025年AI业务赶上炒作,模型竞争激烈,开源、智能体等发展显著,还对未来一年AI发展作出预测。

Founder Park
开源动态8

特斯拉开源硬件,中国公司回应来了:直接把机器人大脑开源了

特斯拉开源硬件专利后,智平方于4月22日发布AlphaBrain Platform开源社区,拿出含具身前沿技术等的“顶配全家桶”。介绍了世界模型、RL Token等5大技术亮点,还说明其用途及智平方过往开源成果与公司实力。

量子位
新闻资讯8

UCSD谢澎涛创业:用AI搞科研,4小时交付顶刊水平成果,已获数百万美金融资

谢澎涛团队推出面向AI for Science的AIBuildAI Science Agent,在NatureBench评测中排名第一,超多数通用编程智能体。该智能体可独立完成模型研发,效率大幅提升,还探讨了其能力边界、应用及对行业的影响。

DeepTech深科技