「分镜能力」共找到 3689 篇相关文章
一文读懂DeepSeek-V3.2核心技术DSA:API疯狂降价性能不减的背后
DeepSeek发布实验模型DeepSeek V3.2,引入自研稀疏注意力机制DSA,API价格最高降75%。DSA先筛选后计算,含闪电索引器和稀疏多潜在注意力两组件,分四步工作,权衡了精确性与速度。
“边说边思考”,Mini-Omni-Reasoner 开创实时语音推理新范式
Mini - Omni - Reasoner将推理能力引入大型语音模型,开创“边说边思考”范式,实现实时语音推理与交互。推出Spoken - Math - Problems - 3M数据集,经四阶段生成流程构建。训练采用分阶段策略,性能超基础模型。
Claude Sonnet 4 支持百万上下文了,AI Coding 的想象力更大了
Anthropic宣布Claude Sonnet 4支持100万Token上下文窗口,容量为之前5倍。该功能已在部分平台公测,将推给更多用户。它支持复杂任务,有新定价和成本优化方案,获早期用户高度评价。
哇塞,今天北京被机器人人人人人塞满了!
世界机器人大会在北京开幕,100多个新机器人亮相。智平方的爱宝机器人人气爆棚,它能用一个基座模型完成多任务。其搭载的GOVLA大模型有四大核心能力,且已在多行业商业化落地。
GPT-5:没有AGI,失望和天花板,最具竞争力的可能是定价
刚看完GPT - 5发布会,整体令人失望。发布会现错误图片,市场反馈不佳,专家认为开发仓促。它有三个型号,基础性能表现不一,在部分测试中不如竞品,亮点是价格有竞争力,代码能力受开发者好评。
LeCun团队揭示LLM语义压缩本质:极致统计压缩牺牲细节
图灵奖得主LeCun团队提出全新信息论框架,对比人类与LLM语义压缩策略。通过构建人类概念分类基准、选30+LLMs,发现LLM虽有语义组织能力,但难处理细粒度差异,侧重统计压缩,人类更重细节语境。
Karpathy最新分享!给大模型做好“服务”将是巨大机会
近日,Karpathy在AI Startup School演讲,提出AI正从根本改变软件。他将软件分三个时代,认为LLM是全新操作系统,还指出其特长与局限,点明AI时代两大机遇:部分自主应用和构建Agent友好工具。
从 “可用” 迈向 “好用”:详解火山引擎智能视频云的三层架构升级|甲子光年
2025年AI关键在多媒体领域,智能多媒体落地有变革也面临挑战。火山引擎提出智能视频云三层架构升级,即基建、平台、应用层升级,助企业实现低成本、高效率规模化应用,多行业已基于此打造能力。
DeepSeek刚解决了AI视觉最后一块拼图:极低成本+精准视觉定位,AI接管电脑已无死角
DeepSeek放出新论文《Thinking with Visual Primitives》,解决多模态大模型中长期被忽视的“说不清位置”问题。提出将空间标记作为“最小思维单元”插入推理链条的方案,在多个任务上达前沿水平,但也存在精度、触发机制和泛化能力等局限。
牛B, 我真的起飞啦,6.4k Star Bright Data CLI~~~~
约6.4k Star的Bright Data CLI想解决AI Agent访问网页难题,把网页变成易被模型读懂的材料。它将网页访问能力拆成终端可组合动作,还关注工程化细节,让Agent上网有章可循。