「好猜想」共找到 785 篇相关文章
CVPR 2026|AI开始会拍电影了:一分钟十镜头,全程不崩剧情
多镜头视频生成要求模型处理不同镜头间稳定信息和变化信息,现有方法有局限。Meta与哥本哈根大学研究者提出OneStory,建立跨镜头记忆机制,设计关键模块,实验表现好,为视频生成打开新可能。
痛点突破:YOLOv26引入AAttn区域注意力机制,精度提升1.3个百分点
文章介绍YOLOv26引入AAttn区域注意力机制,解决传统机制在复杂场景下的不足。它通过划分特征图区域学习权重,提升检测精度,且实现简单。经实验验证,精度提升显著,还给出实现细节与优化建议。
无需任何 API 费用,这个Agent 拥有“看遍全网”的超能力
AI Agent 在网络信息获取上存在诸多难题,而 Agent Reach 能解决这些问题。它免费开源、安全且持续更新,兼容所有 Agent,支持多平台。安装简单,装好即可用,各渠道还能灵活替换。
清华发布世界模型评测新标尺:直击机器人感知与行动鸿沟
清华大学等机构推出 WorldArena 评测基准,用于测试 EWM 真实能力。它融合感知与功能评估,含十六项视频指标,结合主客观评价生成 EWMScore。测试揭示模型在感知与行动上的差距,转型为实用型模型是行业挑战。
开源中小模型+Skills也性能暴增!卢森堡大学探索了小模型驾驭Skills的边界
卢森堡大学等研究探索小模型驾驭Skills的边界。工业界因数据安全渴望开源小模型,智能体Skills框架让小模型性能暴增。研究拆解小模型处理复杂任务的方法,还验证不同策略有效性,发现代码专用模型优势。
5 分钟搞懂开源大模型选型核心维度,16G显卡也能选对
文章以作者自身经历引入,指出开源大模型选型易陷入‘越大越好’误区。讲透选型4个核心维度,含实操步骤与避坑指南,还介绍选后评估方法,助新手快速锁定适配模型。
这可能是今年门槛最低的黑客松比赛,速来!
2026开年Skill热度攀升,因其易搭建易分享且能交付结果。Founder Park联合扣子举办Skill招募大赛,设职场和极客两赛道,有流量、付费等奖励,还公布赛程、报名方式及好Skill的标准。
Google Antigravity推出终端沙盒:AI助手终于不会乱删文件了
Google Antigravity推出终端沙盒功能,用内核级隔离技术限制AI代理终端命令在项目工作目录内,解决其误操作系统文件问题。该功能在macOS实现,Linux支持将到,用户反馈有好有坏。
豆包的新身份曝光:在国际艺术展当起了“AI讲解员”
文章讲述作者在浦东美术馆「AI与艺术」豆包讲解体验日活动的经历,实测豆包作为AI讲解员的业务水平,如筛重点、实时讲解、补知识,还揭秘其靠豆包大模型1.8的多模态处理等能力任职。
从大模型到多模态,图文混排Agent彻底起飞~
上周智谱多模态开源周,从GLM 4.6v到Autoglm,其图文并排使用场景很吸睛。上传PDF论文,它能生成图文混排解读文章,效果好。作者逆向原理复刻代码,还分享GLM 4.6V三个有意思的能力。