「复杂文档处理」共找到 1959 篇相关文章
真机RL!最强VLA模型π*0.6来了,机器人在办公室开起咖啡厅
美国具身智能创业公司PI发布最新机器人基础模型π*0.6,新方法大幅提升具身智能成功率与处理效率。其开发的Recap方法从经验数据获训练信号,使模型能执行多项真实世界应用。
具身机器人征服1万伏高压线!-10℃严寒、13米高空全天候作业零事故
亿嘉和新一代配网带电具身智能机器人能在1万伏高压线上独立完成复杂精细操作,已在多省份部署,完成万余次任务。它“有脑子”,效率接近人工90%且零事故,未来还将迭代升级。
智源悟界 · Emu3.5 重塑世界模型格局:首提多模态 Scaling 范式,AI 理解世界再进化
北京智源研究院发布大规模多模态世界模型“悟界·Emu3.5”,它能模拟复杂动态物理世界,揭示“多模态Scaling范式”。该模型继承深化Emu3技术哲学,在多方面有提升,为世界模型领域提供进化路线。
灵巧手能帮女友拧瓶盖了!同济清华上海交大等新成果 | CoRL 2025
来自多高校研究团队提出KineDex框架,以真·手把手指导方式让人类动作传至灵巧手,同步采集高保真触觉信息,使星动纪元灵巧手星动XHAND 1解锁复杂精细操作,论文已被CoRL 2025接收。
云栖大会阿里掀桌子了!Qwen3-Max、VL、Omini、Agent ... 统统发布!
云栖大会上,阿里云智能首席技术官介绍千问多款新模型发布及一款升级。如万亿参数的Qwen3 - Max,代码和Agent能力强;还有Qwen3 - Coder - Plus、Qwen3 - VL、Qwen3 - Omni、Qwen3 - LiveTranslate等模型各有亮点。
Prompt的尽头,居然是MBTI。
文章介绍了用MBTI人格优化大模型对话的技巧。论文《心理学增强AI智能体》证明给AI一个MBTI人格很有用,不同人格AI处理任务表现各异,还能组建性格互补的AI团队完成不同工作。
用 1/1000 的参数打穿大模型:我为什么强烈推荐 PaddleOCR
PaddleOCR是百度开源的OCR工具,模型参数仅0.07B,却能在复杂场景媲美大模型精度。其新一代PP - OCRv5全面升级,在文本检测等方面表现出色,还稳定增长且在海外受关注。
如何“驯服”你的Agent?这可能是你见过最优雅与可控的Agent框架 | 深度体验
文章聚焦对话式Agent,指出LLM不确定性是企业应用Agent的障碍。介绍Parlant框架,它用ABM方法控制交互,能降低LLM负担、处理边缘场景。还通过构建10086客服助手展示其使用,最后与LangGraph对比。
让具身智能体拥有「空间感」!清华、北航联合提出类脑空间认知框架,导航、推理、做早餐样样精通
清华、北航联合提出类脑空间认知框架 BSC-Nav,让具身智能体有「空间感」。它克服现有导航方法记忆难题,有三大记忆组件,实验中性能碾压,能应对复杂任务,真机实测也表现出色。
谷歌nano banana官方最强Prompt模板来了!先收藏再说
爆火的nano banana让更多人体验到AI对图像生成与处理的革命,网友开发出各类玩法。谷歌官方推出nano banana最强Prompt模板,涵盖写实、贴纸等6种类型,还给出调用API生图示例代码。