多任务架构」共找到 6474 篇相关文章

开源动态7

PDF/DOCX/HTML/扫描文档接卸不再愁!D自动解析文档并统一格式的开源库edoc

Dedoc是开放通用系统,能将文档转换为统一格式,提取逻辑结构和内容。用Python实现,支持种格式,有可扩展性等优势,还能处理扫描文档,可用于个系统,介绍了安装方法。

GitHubStore
开源动态8

仅用图像也能Think:Google等提出一种视觉规划的全新推理范式!

剑桥和Google等提出并开源视觉规划范式,通过纯视觉表示规划,独立于文本。还引入VPRL框架,用GRPO后训练大型视觉模型。实验选三个视觉导航任务,VPRL表现最佳,显著优于其他方法。

PaperAgent
新闻资讯7

GLM-5.3你来定!智谱唐杰全球征集意见,评论区清一色:视觉

清华教授、智谱唐杰在𝕏征集GLM下个版本意见,浏览量达40w+。此前他有求必应,网友热情参与。这次评论区要视觉能力,因GLM-5.2是纯文本模型,而对手模态。

量子位
新闻资讯8

0.7nm制程芯片问世!摩尔定律又活了

IBM推出全球首款0.7纳米芯片制程节点,指甲盖大小芯片可集成近1000亿晶体管,性能或能效大幅提升。靠‘纳米堆叠’架构实现突破,最早5年内量产,有望让芯片微缩延续十年。

量子位
算法论文8

高潮从第几秒开始?GaMMA 让模态大模型真正「听懂」音乐时间线

现有模态大模型难以理解音乐时间线。复旦大学与字节跳动团队提出 GaMMA,采用双编码器融合网络,经三阶段训练,还推出 MusicBench 评测基准。实验显示,GaMMA 在基准上表现优异,刷新 SOTA。

机器之心
新闻资讯8

π0.7发布,VLA押出了机器人的GPT-3时刻

今天凌晨,Physical Intelligence发布VLA模型π0.7,首次在机器人领域证明组合泛化。它用样化prompt处理样数据,涌现种能力,还证明数据过滤可能是伪问题,架构基于前作,推动VLA回归。

量子位
新闻资讯8

除了AGI已来和死亡,我们为黄仁勋重磅访谈总结了50条AI最前沿判断

2026年3月23日黄仁勋在播客访谈提出众前沿判断,如AGI已来,Agent时代开启;智能会成商品,人性才稀缺;推理成本高;合成数据非旁门左道等,还谈及公司架构、算力、供应链等话题。

新智元
开源动态8

字节跳动开源视频生成模型Alive:12B参数,个人电脑也能跑

字节跳动开源视频生成模型Alive,12B参数,支持四种模式,硬件门槛低。在评测中表现出色,技术架构精心设计,解决音视频同步等问题,虽有小瑕疵,但更适合普通玩家。

AI工程化
算法论文8

「听觉」引导「视觉」,OmniAgent开启全模态主动感知新范式

针对端到端全模态大模型痛点,浙江大学、西湖大学、蚂蚁集团联合提出 OmniAgent,它基于「音频引导」,用「思考 - 行动 - 观察 - 反思」闭环实现范式转变,在基准测试中超越开闭源模型。

机器之心
推荐文章7

拯救大模型的逻辑短板:Nature文章预测符号主义AI与神经网络的联姻将引爆下一场技术革命

结合逻辑系统与神经网络成AI热门趋势,神经符号AI崛起,旨在弥补神经网络短板。虽面临技术挑战,但已在领域展现潜力,不过也有质疑声,其发展仍面临诸难题。

AIGC开放社区