「多模态处理能力」共找到 4498 篇相关文章
上周 GPT 和 Codex 各有一个发布,很多人没注意吗?可以解锁 Codex 百万上下文了
最近基模发布多,OpenAI 俩更新被低估忽略。一是 GPT - 5.6 Sol 的 Ultrafast 模式,输出最高达每秒 750 Token,先向少量 API 客户开放;二是 Codex 为其开放百万上下文能力,不过大窗口有代价。
对话港理工吕佳欣:如何将一项实验室成果变成一条6500吨级的生产线?
文章是对港理工吕佳欣的访谈,围绕多筒挤压技术展开,探讨从实验室到产业化的过程、挑战及应对方法,还提及工业AI在制造领域的应用,如数据处理、经验转化等,强调科研与工程相互促进。
DeepSeek,Qwen,Grok组团发布,社区一手实测
LLM大爆发,一天内推出Grok 4.6、Qwen3.8 - Max、DeepSeek - V4 - Pro - 0813三款前沿产品。社区对它们进行多场景测试,如3D场景、Flappy游戏、飞机滑行动画等,并对比了不同模型的性能、价格和输出质量。
SeeDance 2.5:AI 一次能出 30 秒视频,被重新定价的是这几层人
7 月初,字节在火山引擎 FORCE 大会上放出 SeeDance 2.5,它能一次性生成 30 秒完整成片。文章详述其能力,提出视频生成的不可能三角判断框架,还分析它会重新定价产业链上多个环节,改写产出随机性。
一篇Loop+Harness的自进化Agent最新综述
本文分享清华关于经验时代,已部署的 Agent 如何将交互轨迹转化为持久能力,从自我进化到元进化的论文。介绍了 Harness、技能、记忆、环境等方面,还提及 RL 与持续学习、元进化智能体等内容。
比英伟达早,比李飞飞强,大晓Kairos原生一体化世界模型定义物理AI新路线
大晓机器人发布 Kairos 开悟世界模型,其首创“多模态理解 — 生成 — 预测”原生一体化架构,采用跨具身渐进式训练体系和“以人为中心”的数据金字塔,还实现端侧部署,在四大权威具身智能基准上全面登顶。
腾讯老兵+大厂00后新锐,码上飞想做的不只是AI Coding
HDC 2026上华为展示鸿蒙新能力,背后技术服务由创业公司码上飞提供。码上飞核心团队多元,有大厂老兵与02后新锐。其技术积累丰富,开源项目多,还参与标准制定和前沿产研。
阿里云发布为Agent而生的全新AI产品官网“千问云”,模型服务全面Skill、CLI化
5月20日,阿里云在2026阿里云峰会上发布全新AI产品官网“千问云”,提供150多款主流模型API,将模型服务核心能力封装为Skills和CLI工具,方便Agent调用,还提供便捷用量管理和多种付费模式。
当SFT遇上RL:基于样本学习阶段的动态策略优化机制
在大模型推理能力增强研究中,SFT和RL两种后训练范式难有效融合。研究团队提出DYPO动态策略优化方法,先判断样本学习阶段再匹配优化路径,在多场景实验中表现出色,不过有实验边界。
Agent 的第一性问题:Proactive 与 Context 经济学
过去一年AI Agent能力提升,但用户体感未同步变好,原因在于人类注意力窗口有限。赛道分化,主动式桌面Agent是新方向,AirJelly是代表产品,五源资本对其创始人黄柏特进行访谈,探讨产品设计、应用场景等问题。