「长视频数据」共找到 3758 篇相关文章
告别人工干预!KDD Cup 2026 Data Agents 赛道:定义下一代数据智能体能力边界
KDD Cup 2026 发布 Data Agents for Complex Data Analysis 赛道,由香港科技大学(广州)和清华大学联合承办。旨在推动 AI 告别人工干预,具备自主任务分解等能力,还推出 DataAgent - Bench 测试平台,有丰厚奖励,公布关键时间节点。
付费Mathpix公式识别不香了~不要钱舒服!
复杂科学文献中公式识别问题重要,但现有模型有局限。DocTron - Formula通过简单微调在多场景达先进水平,还引入CSFormula数据集。它基于Qwen2.5 - VL微调,在多个数据集上效果佳。
两个Ilya的宿命轮回:老黄10亿美金开启赛博修仙!
OpenAI花1亿美金买Torch做「数据转接头」,想让ChatGPT成全科医生;Claude用超长文本窗口处理医学文献和数据。而NVIDIA投10亿与药企建实验室,用BioNeMo重写生命,开启药物生成新纪元。
AI 大牛刘威创业公司完成 5000 万美元融资,12 月将发布新模型
当地时间11月5日,刘威创立的Video Rebirth完成5000万美元种子轮融资,用于打造视频生成模型。公司计划12月发布Bach模型及AI视频生成平台,将与OpenAI Sora竞争,虽对手强大,但刘威认为小团队有机会。
直接从像素到单词:这个原生大模型统一单图、多图、视频和空间智能
南洋理工大学等团队推出NEO - ov模型,挑战传统「视觉编码器 + 大模型」范式,直接从原始像素学语言。它在多任务表现出色,尤其空间智能突出,但在OCR等方面有短板,展现原生多模态建模潜力。
2025年哪款模型最受欢迎?Poe最新报告:DeepSeek降温、可灵成黑马
AI工具聚合平台Poe发布2025年1 - 5月人工智能模型使用趋势报告。显示模型市场份额消长明显,推理模型势头正劲,图像、视频、音频生成领域各有竞争态势,如DeepSeek降温,可灵成视频生成黑马。
Databricks与OpenAI合作:企业级私有化GPT-5来了
OpenAI和Databricks深度合作,将把GPT - 5等模型原生集成到Databricks平台。企业可在自有数据环境运行模型,通过SQL等调用,Mosaic AI Gateway保障数据安全,多家企业表示期待。
大模型破译甲骨文创下新SOTA!复旦团队推出新框架
复旦大学团队提出基于部首和象形分析的可解释甲骨文破译框架,构建PD - OBS数据集。该框架在公开基准数据集上准确率高,零样本破译能力强,还能为未破译甲骨文输出可解释分析文本,助力考古工作。
又一推理新范式:将LLM自身视作「改进操作符」,突破长思维链极限
Meta等机构研究者将LLM视为「思维」改进操作符,探究并行 - 蒸馏 - 精炼(PDR)推理方法。实验显示,PDR在数学任务中提升准确率,还训练8B模型让推理方法更适配,减少训练与部署的不匹配。
清华刘知远团队论文:最小化结构改动,短文本到长文本丝滑升级 | ICLR 2026
大语言模型发展中,上下文长度成关键瓶颈,主流架构计算开销大。清华刘知远团队提出《InfLLM-V2: Dense-Sparse Switchable Attention for Seamless Short-to-Long Adaptation》,提出可切换注意力框架,为长上下文研究提供新思路。