「电脑操作能力」共找到 3795 篇相关文章
RLinf上新πRL:在线强化学习微调π0和π0.5
近年来,基于流匹配的VLA模型成机器人领域前沿技术,但训练依赖大量人类演示数据。清华等机构联合推出在线强化学习微调框架πRL,提出两种微调方案,在测试平台验证了有效性,目前代码等已开源。
具身机器人征服1万伏高压线!-10℃严寒、13米高空全天候作业零事故
亿嘉和新一代配网带电具身智能机器人能在1万伏高压线上独立完成复杂精细操作,已在多省份部署,完成万余次任务。它“有脑子”,效率接近人工90%且零事故,未来还将迭代升级。
邱锡鹏团队新作:让机器人学会「察言观色」
复旦大学邱锡鹏团队等发布全新操作框架 RoboOmni,突破传统 VLA 依赖显式指令局限。它融合多模态信号,构建数据集,在成功率等方面超基线,以跨模态指令让机器人主动推断意图,开启具身智能‘共情时代’。
我MiniMax,用实习生处理数据,照样屠榜开源大模型
MiniMax M2屠榜开源大模型,引发社区热议。它在注意力机制、数据处理、思考模式上另辟蹊径,公开技术细节。M2团队选Full Attention,雇实习生处理数据,提出交错式思维链策略,强调实用性和泛化能力。
中美六大顶尖模型第一赛季实盘量化交易结果出炉:Qwen最后反超夺冠,GPT-5垫底「复盘」
Nof1机构发起Alpha Arena项目,让六个顶尖LLM在Hyperliquid交易所实盘量化交易。第一赛季已结束,Qwen夺冠、GPT - 5垫底。复盘比赛过程,发现模型行为差异大且操作有脆弱性,第二赛季筹备近尾声。
世界模型有了开源基座Emu3.5!拿下多模态SOTA,性能超越Nano Banana
北京智源人工智能研究院的悟界·Emu3.5是最新最强的开源原生多模态世界模型,能处理图、文、视频任务,在多项权威基准上性能亮眼,还具备理解长时序等能力,背后有技术创新,且选择开源。
GraphRAG圈新秀:文档级RAKG
随着大模型能力增强,知识图谱成研究热点。传统KGC有实体消歧难、模式僵化等痛点。文章提出RAKG框架,将RAG评估机制引入知识图谱构建,实现文档级自动化构建与评估,多指标表现优异。
谷歌最强AI,被港科大开源超了?让海外创作者喊出「King Bomb」的P图大杀器来了
图像编辑与生成模型爆发,冲击Photoshop地位。港科大贾佳亚团队开源DreamOmni2,优化升级多模态指令编辑与生成能力,效果获海外创作者认可,还在实测中表现出色,其采用创新技术方案构建多模态生成体系。
开源PDF表单自动化神器,一行命令,把静态 PDF 变成交互表单!
平时拿到的PDF表单大多无法直接填写,操作繁琐。GitHub上的开源工具CommonForms能自动识别PDF表单区域,一键生成可填写的交互式表单,基于深度学习模型FFDNet,功能强大且使用简单,还保障数据隐私。
灵巧手能帮女友拧瓶盖了!同济清华上海交大等新成果 | CoRL 2025
来自多高校研究团队提出KineDex框架,以真·手把手指导方式让人类动作传至灵巧手,同步采集高保真触觉信息,使星动纪元灵巧手星动XHAND 1解锁复杂精细操作,论文已被CoRL 2025接收。