「通用子空间」共找到 1339 篇相关文章
字节开源了一款多模态神器!BAGEL上线,超越Qwen2.5-VL,媲美SD3!
多模态AI发展进入新阶段,字节跳动开源通用多模态大模型BAGEL。它支持多模态输入输出与思维链推理,性能超Qwen2.5 - VL等,安装使用友好,有多种应用场景。
黄仁勋提前锁定20年OpenAI芯片收入!第一轮150万GPU卖2000亿美元
英伟达推出‘LPS’概念,联合投资机构出5000亿美元建数据中心,为客户担保。首个项目为在美为OpenAI建150万GPU数据中心,20年或带来巨额芯片收入。黄仁勋也对相关风险做了澄清。
VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测
近年来,VLA模型成通用机器人控制重要路线,但模型大、动作更新慢的矛盾凸显。华中科技大学联合华为提出TurboVLA,绕开大语言模型,形成V+L→A路径,降低成本,保持操作能力。
这个周末,很多人都在等一个额度重置,以及对 Work 模式的吐槽
ChatGPT Work 模式上线后,Token 消耗快,用户等额度重置。该模式与 Codex 易混淆,前者处理通用知识类长任务,后者面向软件开发。国内外产品纷纷推 Work 模式,未来或融合。
LiveWorld:视频世界模型新范式,让镜头之外的世界继续演化
现有视频世界模型存在“静态世界假设”,物体离开视野后状态不再更新。阿德莱德大学等研究者提出 LiveWorld,将世界演化与观察渲染解耦,使事件在视野外持续推进,并通过实验验证其有效性。
谁不想要一条会飞的鱼呢?他们造了个会捣蛋的机器人,拿下了最佳论文奖
庆应义塾大学徐铭阳和香港城市大学李彦衡发表论文Floating Companion,获ACM DIS 2026最佳论文奖。他们研究软体浮空机器人,探讨其与人的关系、交互可能,虽面临浮力 - 质量循环等挑战,但对其未来充满期待。
让大模型“边看边改”,视觉分割准确率直接上涨9% | ICML 2026
复旦、创智联合推出RSAgent,让多模态大模型通过多轮工具调用生成准确掩码,解决视觉分割难题。该工作入选ICML 2026,实验显示其在多个测试集上表现领先,还展示了从‘看图问答’到‘视觉行动’的路径。
李想重画具身智能
理想汽车在成立的十一年里,擅长将复杂技术与家庭出行需求对齐。2026年,理想不再满足于打造更好的家庭车,提出造能感知、思考、行动、反馈的硅基生命体。李想提出具身智能上下半场论,理想重构研发体系,以造人方式造车。
图像编辑模型不止生成:BIGAI&上交大提出EAR范式,系统测试其视觉规划能力
上海交通大学联合北京通用人工智能研究院提出EAR范式,构建AMAZE基准,分析图像编辑模型视觉推理能力。研究发现模型零样本表现弱,扩散式模型更适合视觉规划,CoT效果不稳定等。
1M 上下文时代太费 Token,告诉你我的 Coding Agent 省钱方法
当下GPT-5.5等模型原生支持1M上下文,虽能支撑长任务,但易被噪音干扰且费Token。作者以Claude Code为例,介绍做好会话管理的多种省钱方法,如根据任务选择会话策略、利用rewind功能等。