「长链复杂性」共找到 967 篇相关文章
Sora没做到的,LongVie框架给解决了,超长视频生成SOTA
视频生成近年进步大,但生成超1分钟高质量长视频仍难。上海人工智能实验室等机构提出LongVie框架,解决时序不一致和视觉退化问题,还推出评测基准LongVGenBench,该框架在多项指标达SOTA。
训练提速5倍,响应缩短50%:动态自感知能力,重塑高效LLM Reasoning范式
大型语言模型“思维链”技术有冗余,传统优化方案存在静态先验与动态能力错配问题。论文提出的DR.SAF框架赋予模型动态自感知能力,通过三模块协作,实现推理“精准瘦身”,解决根本冲突。
AI 时代操作系统的三重叙事:技术重构、国产化突围与生态共建
《AI 进化论:智算时代操作系统的破局之路》首期,周明辉、马涛围绕 AI 对操作系统的影响等核心命题展开对话。指出 AI 让操作系统面临挑战,技术演进分两条路径,还谈到安全、国产化、生态共建等问题。
并行革命,32倍吞吐量跃升!英伟达Helix架构突破百万Token推理瓶颈
英伟达推出受DNA结构启发的Helix并行技术,能解决大模型处理长任务时的卡顿问题,提升上下文长度、并发能力并降低响应延迟。不过也有人认为其技术与实用性有差距。
更多thinking≠更好结果,精准thinking可砍掉一半长度
当前大模型如GPT - 4、DeepSeek推理又长又啰嗦,论文发现其在简单题目上过度推理。作者提出‘无效思考’概念,还给出解决原则,用LC - R1方法训练,效果显著,揭示精准思考才是王道。
清华SageAttention3,FP4量化5倍加速!且首次支持8比特训练
清华大学陈键飞团队提出针对BlackWell架构的SageAttention3,实现5倍于FlashAttention的推理加速,首次支持8比特训练。在多种大模型上保持端到端精度,代码将分别于6、7月开源。
全球最强编码模型 Claude 4 震撼发布:自主编码7小时、给出一句指令30秒内搞定任务,丝滑无Bug
Anthropic 首届开发者大会发布 Claude 4 系列,含 Opus 4 和 Sonnet 4 两型号,编码、推理能力强。Opus 4 处理长任务出色,是最佳编码模型;Sonnet 4 经济高效,被 GitHub 等采用。Claude Code 工具也正式发布。
半导体封测:高速增长的背后
近期国内半导体封测企业披露财报,行业发展迅猛,多数厂商业绩增长。汽车电子和AI成关键驱动力,先进封装重要性凸显,多数企业在该领域布局。不过部分厂商出现增收不增利情况。
大语言模型为何会“说谎”?6000字深度长文揭秘AI意识的萌芽
2023年12月至2024年5月,Anthropic发布三篇论文,证明大语言模型会“说谎”,揭示了堪比人类心理的四层心智架构,可能是人工智能意识的起点。论文还分析了AI“说谎”原因,展示其意识萌芽,引发对赋予AI意识后果的思考。
腾讯再次试水?社交电商可不单单是拼流量这么简单!
社交电商的核心竞争力并非仅仅在于流量,而是商品和服务的品质。腾讯通过微信小商店等尝试,不断探索社交电商模式,但真正的成功还需依靠供应链和商品质量。