「视觉语义场景补全」共找到 2626 篇相关文章
全球首个科研LLM竞技场上线!23款顶尖模型火拼:o3夺冠,DeepSeek第四
Ai2耶鲁NYU联合推出科研版「Chatbot Arena」——SciArena,23款顶尖大模型比拼科研任务,OpenAI o3夺冠,DeepSeek第四。该平台解决通用基准测试在科研场景‘失效’问题,但其自动评估系统猜科研人偏好远未及格。
奇绩创坛 2025 春季路演:Agent、具身、Infra、AI4S,57 个项目完整介绍
奇绩创坛2025年春季创业营路演日,57家公司参与。项目集中在场景智能、空间/具身智能等方向,覆盖AI Agent、智能硬件等赛道,还展示了前沿科研和创业项目。文章介绍了各项目的一句话介绍、简介和团队情况。
小红书hi lab首次开源文本大模型,训练资源不到Qwen2.5 72B 的四分之一
6月6日,小红书hi lab团队首次开源文本大模型dots.llm1,采用MIT许可证。该模型激活参数量140亿,总参数量1420亿,上下文长度32K。训练资源不到Qwen2.5 72B的四分之一,在多个测评中表现出色。
一个记忆库,N 个 AI 助手用!mem0 OpenMemory MCP 打通 Cursor/Claude/Windsurf ~
OpenMemory MCP是本地运行的共享记忆系统,基于MCP协议,让多个AI工具共享上下文记忆。它通吃主流MCP客户端,提供标准API,数据私密,有可视化面板且一键安装。官方列举应用场景,虽扩展性待考,但方向值得关注。
谷歌开源移动端AI自动化测试神器
本文介绍谷歌最新开源的移动端AI自动化测试工具ARTEMIS,它可将自然语言指令转化为Android自动化操作,支持跨App测试、多模态定位,在AndroidWorld基准评测中取得99%+任务完成率,提供多场景使用方式,可一键快速上手。
60天融资数千万,何泳澔出任CTO!这家黑马冲刺「最后一公里」
本文报道具身智能赛道初创虚时科技,60天内累计完成数千万元融资,前地瓜机器人具身智能算法负责人何泳澔出任CTO。公司押注仿真训练解决机器人落地数据瓶颈,推出全链路闭环仿真训练系统,已获得工业场景订单。
Google 发布 Gemini 3.8 Flash:6 周内第 3 次升级
Google DeepMind 官宣发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两个新模型。3.8 Flash 在软件工程等方面有显著提升,跑分成绩亮眼,价格实惠,性价比高;3.8 Flash Cyber 面向网络安全场景。目前 3.8 Flash 已在多平台上线。
不做手机缩小版:AI 健康记录迁到手腕,要跨过哪些工程鸿沟?
文章围绕HarmonyOS的穿戴应用,如‘小卡健康’等,探讨将AI健康记录迁移到手腕面临的工程挑战。介绍了应用场景、系统能力调用,以及从接口到产品可用需解决的问题,强调要以用户体验为导向进行产品优化。
解码提速15.1倍、多任务性能不降:复旦&引望WAM-Diff2打通自动驾驶VLA自回归—扩散转换
视觉-语言-动作(VLA)模型是端到端自动驾驶主流技术,但自回归解码架构有瓶颈。复旦大学与引望智能联合提出WAM-Diff2,实现自回归VLA向离散扩散模型迁移,解码加速15.1倍,多任务性能不降。
北大2篇Skill炸场,Agent彻底进化
北京大学连发两篇论文,给出让 Agent 变强的答案:让 Skill 自己进化。`SESA` 针对工具增强的搜索问答,用四个阶段闭环使任务生成和技能记忆一起进化;`VeriSkill` 把验证器废信号变成可信更新,二者场景不同但核心一致。