「视觉智能体」共找到 4003 篇相关文章
北大出品:全球首个支持生成华为鸿蒙应用的AI Agent来了
华为2025开发者大会上,华为终端CEO何刚点名「码上飞」AI Agent。它利用多智能体系统技术,实现开发全流程自动化,用户用自然语言提需求就能生成应用,实测5分钟可开发出睡眠助手app。
上下文工程的崛起:提示工程已是过去式
大模型应用从简单问答转向复杂智能体系统,技术焦点正从提示工程转向上下文工程。上下文工程核心是为大模型提供恰当信息与工具,其重要性日益凸显,且与提示词工程有明显区别。
PDF难点解析:处理复杂表格、水印、印章、复选框、信息抽取等7项任务,6大能力
文章介绍Nanonets - OCR - s可处理关键信息提取、视觉问答等7项任务,具备LaTeX方程识别、图像描述等6项能力,还给出体验链接。但测试发现英文体验优于中文,模型有重复输出、幻觉严重问题。
揭秘开源Agentic‑Doc真能支撑120 W+ 查询?医疗/金融/法务都在用,确实是有这么 6~~~
LandingAI的Agentic Document Extraction是领先OCR且具视觉结构化能力的Python SDK,可处理复杂文档。它功能丰富,架构合理,支持多格式输出。在多行业有应用,性能提升显著,与同类项目相比优势明显。
图灵巨擘RL教父齐聚,机器人秀拳脚嗨翻全场!「悟界」首发引爆物理AGI
智源大会开幕,四位图灵奖得主等出席。会上,Bengio提出‘科学家AI’应对安全风险;Sutton称AI迈入‘体验时代’;Hausman讲构建物理智能。智源还发布‘悟界’系列大模型,含Emu3、Brainμ等,迈向物理AGI。
华为海思老兵上海创业,拿到亿元投资!
过去两年汽车行业竞争激烈,智能驾驶芯片成关键领域。近日,上海为旌科技完成A2轮融资首次交割,获君信资本1亿元。其创始人郑军是海思老兵,带领公司研发多款芯片,还提出诸多行业见解。
机器人学会「眼看手摸」!FreeTacMan 实现人类指尖亲自「授课」
OpenDriveLab提出的FreeTacMan,将人类视觉、触觉和动作技能高效传输给机器,破解精细操作难题。它配备高分辨率触觉“皮肤”,实现人类“手把手”教机器人“感知”,还通过融合时间感知的触觉预训练,提升机器人策略性能。
RSS 2025|从说明书学习复杂机器人操作任务:NUS邵林团队提出全新机器人装配技能学习框架Manual2Skill
新加坡国立大学邵林团队提出 Manual2Skill 框架,利用 VLMs 将说明书视觉指令转化为机器人装配技能,含层级化装配图生成、分步骤位姿估计、动作生成与执行三阶段,实验验证其在多场景的有效性。
不懂建模也能做角色!VAST升级AI神器,一手实测来了:一键拆建/魔法笔刷/万物绑骨
3D大模型明星初创公司VAST推出的Tripo Studio大升级,有智能部件分割、贴图魔法笔刷等四大核心功能,直击过去建模流程痛点,实现从“给模型”到“交成果”的质变,提升全链路效率。
太顺手啦,这款开源框架让AI助手秒级接入应用,狂揽20.5K星!再见繁琐AI开发
CopilotKit是基于React的开源框架,开发者能以极简代码将智能助手集成到Web应用。它有三分钟集成、场景感知等优势,具备五大核心功能,适用于多场景,三步即可入门,比同类项目更有优势。