多模态技术」共找到 3554 篇相关文章

算法论文8

AI终于“长”进机器人身体里!机械臂学会用触觉思考

香港科技大学申亚京教授团队研发出具身机器人手臂 EmArm,实现亚毫米级触觉定位与实时‘感知 - 行动’闭环。研究还提出‘感知 - 驱动’一体化算法,为打造物理 AI 机器人提供可扩展技术路径。

DeepTech深科技
开源动态8

离大谱!15k Star book-to-skill,我惊到了!!!

book-to-skill是将书籍、文档目录或多份资料转换成Agent Skill的命令行工具。它把资料拆成可按需加载的知识资产,有按需加载章节等优势,适合将常用知识编译成技能,不过也有一定局限性。

小华同学ai
产品应用8

Qwen3.8-Max:编程与办公,全面跃升

今日正式发布Qwen3.8-Max,下周将开源其及Qwen3.8 - 27B模型权重。它参数达2.4万亿,在多方面全面提升。开发者可通过千问AI平台获API服务,性价比高。在编程、办公等场景表现出色,用户反馈良好。

千问大模型
产品应用8

Agnes AI 实测:AI 编程真正的瓶颈,99%的人想错了

本文实测Agnes AI,指出AI编程瓶颈在于缓存命中率,而非模型智商。介绍其产品线、评测成绩与价格优势,还分享客户端体验,包括亮点、回滚事故及日志结论,最后点明智能免费后验证更稀缺。

AI科技评论
新闻资讯7

Sutton、OpenAI 联创押注的持续学习,有中国团队带着模型进场了

7 月,TML 发布 Inkling 模型,Mind Lab 发布 Macaron V1,二者均针对持续学习场景。持续学习走「参数空间的迭代」路线,让模型用得越多越好用。硅谷已有不少新尝试,产业链正在形成。

Founder Park
推荐文章7

对话灵感实验室:全帧率 VLM、低成本与分层部署,业务现场不止需要炫技模型

InfoQ对话格灵深瞳灵感实验室,探讨多模态大模型下视频理解问题。指出传统视频模型抽帧处理浪费算力和信息,介绍LLaVA - OneVision - 2.0突破长视频理解瓶颈,还提及“视觉智能工坊”助力业务落地。

InfoQ
新闻资讯7

马斯克诉OpenAI案终落幕:1500亿索赔因“告晚了”被驳回

2026年5月18日,“马斯克起诉OpenAI”案裁决,OpenAI无需担责,马斯克诉求被驳回,原因是诉讼时效已过。这场官司拉扯两年多,索赔从数十亿增至1340亿美元。庭审暴露双方问题,后续资本战将开启。

DeepTech深科技
新闻资讯7

独家|浙大00后世界模型创业,完成新一轮亿元融资,已在多个产业领域实现交付

2021年浙大陈天润成立魔芯科技,早期围绕AI驱动3D内容生成。2024年底转向3D场景建模和世界模型,走纯隐式方法。团队年轻有优势,已产生收入,完成融资,将推新模型,目标是实现‘3D的ChatGPT时刻’。

DeepTech深科技
算法论文8

强化学习的进化:从PPO到MaxRL,LLM推理训练的算法演进史

本文概述2024 - 2026年推理LLM的强化学习进展,从REINFORCE和PPO讲起,介绍GRPO、RLOO等多种算法。指出critic模型非必需,标准差归一化有副作用,损失聚合很关键,信任域是优化切入点,还提出几个未解决的挑战。

机器之心
推荐文章8

热门 Skill 精选介绍

文章介绍热门Skill,含元技能、专家经验包、前端设计开发等多领域技能。如find - skills可帮用户发现安装技能,frontend - design强调前端设计美学,last30days能生成多平台趋势研究报告。

AIGC开放社区