多模态文档处理」共找到 2012 篇相关文章

开源动态8

阿里发布信息检索Agent,可自主上网查资料,GAIA基准超越GPT-4o | 模型&数据开源

阿里发布WebDancer信息检索Agent,能自主上网查资料。它具备多步推理等能力,采用四阶段训练范式,模型和方法已开源。在多个基准测试中表现优异,突显处理复杂任务的鲁棒性和有效性。

量子位
算法论文8

一键开关灯!谷歌用扩散模型,将电影级光影控制玩到极致

Google推出LightLab项目,可从单张图像精准控制光影,解决传统光影控制难题。其通过特殊数据集微调扩散模型,让模型学会控制光照,还介绍了方法、后处理流程等,实验显示表现优,有多种应用。

机器之心
新闻资讯8

ChatGPT最强网络安全模型,逼谷歌紧急修漏洞!

OpenAI推出安全专用模型GPT-5.6-Cyber,用于处理信息安全任务。它战绩斐然,发现诸多内核漏洞。Daybreak计划为安全人员提供工具。该模型虽有不足,但展现出强大的网络安全能力。

新智元
新闻资讯7

人才黑洞!UC伯克利系主任都加入A社了

UC伯克利EECS系主任Jelani Nelson暂离大学,加盟Anthropic预训练团队。他算法课播放量超2100万,研究聚焦大规模数据高效处理,这正是A社所需,此前他还在谷歌兼职。

量子位
产品应用8

阿里发布首个「音视频实时交互」模型,实现数字人实时视频聊天

阿里发布原生流媒体端到端模型Wan - Streamer v0.1,能实时聆听、观看、思考、说话和响应视频。它在单个Transformer内完成感知等操作,延迟低,具备端到端多模态统一、低延迟等特点。

开源AI项目落地
开源动态8

5.6K Star!原本付费现在开源!本地版“ElevenLabs”,视频翻译+声音克隆全免费!

今天给大家安利GitHub上开源神器Voice - Pro,它原本是商业付费软件,因团队无暇管理而开源。整合多个先进语音模型,将视频处理流程打包成本地软件,免费且功能强大。

开源星探
推荐文章7

我的AI OS搭建思路

作者黄益贺分享AI OS搭建思路。其系统以Claude Code为框架、Kimi K2 Thinking为模型,通过Skill和自定义命令满足工作需求,设计三层文件夹体系处理信息,供大家参考搭建。

newtype AI
开源动态7

解放双手!开源 AI 桌面智能体

桌面智能体Bytebot是拥有专属计算机的人工智能,有完整虚拟桌面。它能使用任意应用、处理文档等。赋予AI独立计算机可解锁新能力,项目地址为https://github.com/bytebot-ai/bytebot。

GitHubStore
新闻资讯8

麻省理工AI放王炸!无需说话、秒懂你的想法,外挂AI大脑来了

今天凌晨2点,麻省理工学院分享突破性研究Alterego。它是可穿戴无声语音交互AI设备,通过捕捉神经肌肉信号实现无声沟通,处理后用骨传导耳机反馈结果,应用场景广泛,还能帮助残疾人交流。

AIGC开放社区
算法论文8

夜间感知新突破!北航等提出红外主导的高效目标检测方案 | ECCV'26

在复杂视觉场景中,传统RGB - IR多模态检测方法在低照度等场景下因RGB退化影响检测效果。北航等团队提出的InfraNet,以红外为主,用质量感知机制控制RGB引导,在多数据集取得强竞争力结果。

新智元