「视频推理数据集」共找到 4903 篇相关文章
Memvid:把你的文档库变成一个小巧的视频,还能瞬间搜出你想要的!
传统向量数据库因高成本和复杂运维让开发者却步。开源项目Memvid将文本数据存入视频文件,能高效检索,解决存储冗余、检索延迟和网络依赖问题,使用简单,虽处概念原型阶段但值得尝试。
刚刚,OpenAI最强推理模型o3-pro诞生!碾压Gemini 2.5 Pro击穿底价
OpenAI昨夜官宣上线最强推理模型o3 - pro,还将o3价格暴降80%。o3 - pro专为深度思考和提供超可靠答案而生,在多项测试中表现优异,虽有速度慢等限制,但优势明显,网友实测效果惊艳。
语义分割别无脑用Argmax!港中文新算法:三行代码,推理速度提升10倍
香港中文大学提出全新算法框架RankSEG提升语义分割性能。传统方法用threshold或argmax生成掩码并非最优,RankSEG无需重训模型,加三行代码就能提高分割指标,还开源了工具包,其改进版RankSEG - RMA推理速度大幅提升。
一篇论文改写AI科研评价规则!中国公司拿出实践数据,双榜第一、成本更低
今年科技巨头入局AI4S,想打造“AI科学家”。8月19日《Measuring AI Scientists: From Exams to Discovery》论文提出评价范式。深度原理MIRA平台是现实样本,在评测中表现优异,沉淀闭环数据。
真·养虾!3步让龙虾边聊边进化,不用GPU不用数据集就能强化学习
程序员给智能体套在线强化学习系统MetaClaw,把用户与AI对话变训练数据。它基于Kimi - 2.5,用SkillRL框架,不依赖本地GPU,训练交Tinker云平台,三步即可上手。
对话清华商宇丨从生成视频到支撑行动,世界模型需要新的评测标准
文章围绕清华团队提出的 WorldArena 评测框架展开。它针对具身世界模型,对过去沿用视频生成的评测逻辑重新审视,从视觉质量和功能性任务两维度评估,推动世界模型从‘生成世界’迈向‘使用世界’。
Kimi开源新线性注意力架构,首次超越全注意力模型,推理速度暴涨6倍
月之暗面发布开源Kimi Linear架构,用新注意力机制首次超越全注意力模型。长上下文任务中,它减少75%的KV缓存需求,推理加速达6倍。核心创新Kimi Delta Attention有细粒度遗忘门控等特点。
缺数据也能拿SOTA?清华&上海AI Lab破解机器人RL两大瓶颈
现有机器人视觉 - 语言 - 动作(VLA)模型训练范式存在数据采集成本高、泛化能力不足等问题。清华和上海AI Lab团队提出SimpleVLA-RL,解决了VLA模型训练的核心瓶颈,在多基准测试中实现SoTA性能。
OpenAI重新开源!深夜连发两个推理模型,o4-mini水平,笔记本、手机可跑
OpenAI 自 GPT - 2 后重新开源,此次连发两个推理模型 gpt - oss - 120b 和 gpt - oss - 20b。它们性能达 o4 - mini 水平,可在笔记本、手机运行,有宽松许可等亮点,在多测试中表现出色。
DPad: 扩散大语言模型的中庸之道,杜克大学陈怡然团队免训推理加速61倍
扩散大语言模型(dLLMs)有全局规划能力,但存在计算冗余。杜克大学陈怡然团队揭示其“草稿纸机制”,提出免训练方法DPad,结合现有技术,能在几乎无损精度下实现高达61.4倍推理加速。