多模态 Agent」共找到 3498 篇相关文章

新闻资讯7

实锤了,Meta 正式收购 Manus

近日,Manus 官网官宣“加入 Meta”。Manus 致力于打造通用 AI Agent,能处理复杂任务。这是笔待完成交易,未披露条款。Meta 在 AI 落地应用缺具象答案,收购它或是选已跑通逻辑的产品融入底层。

MacTalk
推荐文章7

人生周报v044:费曼

文章围绕AI应用展开,指出人机交互是AI应用竞争壁垒,介绍典型案例及交互形态,分析Agent不同场景,还提及AI应用创业要素,最后推荐《费曼经典:一个好奇者的探险人生》。

李继刚
算法论文8

AI发现医生看不见的隐藏心脏病风险,近90%准确率远超人类专家|Nature子刊

登上《Nature》子刊的研究显示,约翰霍普金斯大学团队开发的多模态AI模型MAARS,用深度学习处理原始MRI图像,实现对心源性猝死风险高精度预测,准确率达89%,还能辅助制定个性化医疗方案。

量子位
产品应用7

刚刚,全网最猛AI视频模型免费了!我们手搓了一段「牛来」,效果绝了

AI短剧火爆,但创作者面临成本高痛点。Agnes Video 2.5系列模型上线Pavo平台,成本低效果好,其Flash版免费。Pavo还有「无限画布」和「Agent创作模式」,降低返工成本,实现低门槛创作。

新智元
产品应用7

codex降智大bug找到了,一句话让它把智商找回来!

近日Codex被降智,网友监测其智商曲线下降。L站大佬发现大bug及解法,在全局agents.md加特定语句,可让它大幅恢复智商。测试显示,加语句后正确率提升,降智概率降低。

探索AGI
推荐文章8

真正能用好AI的企业是怎么做的?(附企业级AI落地实战手册)

数字化深入,非结构化文档成企业难题。合合信息发布白皮书,提出复杂文本智能五大核心能力标准,用11个行业标杆案例展示多模态文本智能技术应用,提供可复制落地范本。

PaperAgent
新闻资讯7

Gemini 3「开眼」像素级操控!谷歌回应DeepSeek-OCR2

Google DeepMind为Gemini 3 Flash推出Agentic Vision,让模型主动编代码操控图像,性能提升5% - 10%。该能力已上线,谷歌还计划扩展功能。这或许是受DeepSeek-OCR2刺激,两者技术路线不同。

新智元
推荐文章7

RL 是新的 Fine-Tuning

今年 9 月,Thinking Machines 研究使 LoRA 重获重视。OpenPipe 创始人 Kyle Corbitt 访谈指出,多数场景微调 ROI 低,RL 将融入 agent 生命周期成主流,但 RL 落地难在环境搭建,World Model 或为关键。

海外独角兽
算法论文7

“扁平+拓扑”双索引,85页PDF"秒级"推理,MMRag幻觉率骤降76%

文章聚焦多模态长文档视觉问答,介绍现有LVLM - based和RAG - based技术路线及困境。提出MMRAG - DocQA方案,引入‘分层索引 + 多粒度检索’,设计双索引建模相关性与依赖,用互补策略实现证据互补。

CourseAI
算法论文8

手机AGI助手还有多远?移动智能体复合长程任务测试基准与调度系统发布

上海交大与澜舟科技研究发现现有移动端GUI智能体处理复合长程任务能力不足,提出UI - Nexus测试基准和Agent - NEXUS调度系统,经实验能提升任务完成率,也为AI原生操作系统建立雏形。

机器之心