「统一心智科学」共找到 768 篇相关文章
谷歌首个原生多模态向量模型发布:Agent 可以用文字搜图片、用图片搜视频了...
谷歌推出首个原生多模态嵌入模型Gemini Embedding 2,通过Gemini API和Vertex AI公开预览。它将文本、图像等映射到统一向量空间,支持多模态交错输入,性能超越现有领先模型,开发者可快速接入。
前阿里P10毕玄的一张聊天截图竟然火了。
AI Coding发展迅猛,前阿里P10毕玄所在公司决定将技术岗位统一为Agent工程师,不再按技术栈划分。以前按技术栈分工模式合理,但现在程序员需适应变化,不然会被边缘化。
AAAI 2026 Oral | 手机传感器正在泄露隐私?PATN实时守护隐私安全
移动应用获取手机传感器数据支撑重要功能,但带来隐私隐患。西安交通大学与东京科学大学在AAAI 2026提出PATN框架,基于对抗攻击思想,设计两大核心技术,能在多种场景下守护隐私安全。
首次!世界模型、动作模型融合,全自回归模型WorldVLA来了
阿里巴巴达摩院提出全自回归模型 WorldVLA,首次融合世界模型与动作模型,统一文本、图片、动作理解和生成。它用独立编码器处理多模态数据,还提出策略解决误差累积问题,实验表现优异。
8秒极速生成!复杂场景图像定制低成本轻松驾驭,已开源丨字节北大联合发布
字节跳动与北大联合推出支持多条件组合的统一图像定制化生成框架DreamO,能实现主体、身份等多样化定制。与商业大模型比,它开源、成本低、速度快,8 - 10秒可完成图片定制。
让两个大模型「在线吵架」,他们跑通了全网95%科研代码|深势发布Deploy-Master
科学计算领域开源软件多,但多数无法直接运行,制约可用性。Deploy - Master 针对此开发,通过搜索筛选工具、双模型博弈构建,将部署成功率提至 95%以上,为 Agentic Science 提供行动基座。
NeurIPS 2025 | 北大联合小红书提出Uni-Instruct:ImageNet单步生图FID进入1.0时代!
北大联合小红书提出的 Uni - Instruct 框架被 NeurIPS 2025 接收,它统一超 10 种单步扩散模型蒸馏方法,在多项任务达最佳性能,还能用于文本到 3D 生成。
Google推出 AI 科学家:自动编写专家级代码,40个新方法碾压人类 SOTA
Google新发布的AI系统能编写科学软件、发明新方法,结合大语言模型与树搜索技术。在生物信息学、流行病学等多领域超人类最优水平,引发网友对科研影响的讨论。
上海AI实验室发布 Intern Lumina U2:全离散扩散建模,让模型既能“看懂”也能“生成”
上海人工智能实验室发布新一代多模态统一模型 Intern Lumina U2,基于全离散扩散建模路线,支持多任务,适配两大硬件生态,在昇腾千卡级集群训练效率提升 1.85 倍,性能优异且将开放资源。
人形机器人不再「走走停停」:Current Robotics发布全身灵巧操作模型Curr-0
具身智能领域中,让机器人移动中精细操作一直未被很好解决。Current Robotics发布全身灵巧操作模型Curr - 0,用Single Policy统一策略,数据源于自研外骨骼系统,还构建世界模型解决评测部署难题。