超节点技术」共找到 4675 篇相关文章

算法论文7

复旦等推出「第一人称视听基准」,补齐多模态模型「听觉拼图」

多模态大模型在真实世界会“失聪”,现有第一人称视频问答/理解基准长期偏“视觉中心”。复旦等团队推出首个系统评测第一人称声音理解能力的基准EgoSound,能让模型听懂世界,评测显示当前模型与人类差距大。

量子位
开源动态8

单卡2秒生成一个视频!清华联手生数开源TurboDiffusion,视频DeepSeek时刻来了

清华大学TSAIL实验室和生数科技联合开源视频生成加速新框架TurboDiffusion,能让视频生成在保证质量下最高提速200多倍,单张显卡就能运行,还整合四项关键技术,有诸多应用意义。

开源星探
开源动态8

NeurIPS 25开新坑:145万个图文对,覆盖八种主流水下理解任务

华中科技大学团队推出首个水下多模态大模型NAUTILUS,支持8种水下场景理解任务,还开源145万图文对的NautData数据集。模型通过VFE模块解决水下图像问题,性能越现有模型,恶劣环境表现更佳。

新智元
新闻资讯7

两份报告,两种 PMF:ChatGPT 跑通了 Copilot,Claude 验证了 Agent

OpenAI和Anthropic发布核心产品使用报告,展现ChatGPT和Claude用户心智差异。ChatGPT像Advisor,以询问、写作为主;Claude似Agent,随模型能力提升,用户倾向用其执行自动化任务。

Founder Park
新闻资讯7

刚刚,清华姚班校友陈丹琦加入Thinking Machines!和北大翁荔做同事

清华姚班校友陈丹琦将全职加入Thinking Machines Lab。她是IOI金牌得主、斯坦福博士,论文引用逾7万次。该实验室由OpenAI前CTO等联合创立,陈丹琦加入后成AI创业圈女性力量代表。

新智元
产品应用8

深夜突袭!谷歌Gemini 2.5 Pro更新蝉联榜一:推理越o3,编程越opus4

深夜谷歌对Gemini 2.5 Pro模型重大更新,在编码、推理等测试中越o3,几周内成稳定版。其价格优势大,还增加思考预算,输出风格和结构改进,用户实测反馈佳,但发布不久被越狱攻击。

机器之心
开源动态8

单卡搞定万帧视频理解!智源研究院开源轻量级长视频理解模型Video-XL-2

智源研究院联合上海交通大学等机构发布新一代长视频理解模型Video-XL-2。它单卡能处理万帧视频,编码2048帧仅需12秒,在效果、长度和速度上全面优化,已开放模型权重。

量子位
算法论文8

1/15成本,实现AI水印新SOTA | 南洋理工大学&A*STAR

给AI生成作品打水印成行业共识,但传统方法有短板。南洋理工大学等机构研究人员提出局部鲁棒图像水印方法MaskMark,成本仅为Meta模型WAM的1/15,在多任务中表现优异。

量子位
算法论文8

14B检索能力过Google Search,阿里ZeroSearch通过RL激发LLM检索推理能力~

有效信息搜索对提升LLMs推理和生成能力重要,当前RL方法有文档质量不可控和API成本高问题。阿里通义Lab提出ZEROSEARCH框架,经多步骤训练,实验显示其在检索能力和泛化性上表现出色。

PaperAgent
新闻资讯7

聚焦物理智能最前沿,PAIR首届年度会议即将开启!

当大模型能理解语言与图像,‘物理智能’指向智能从比特到原子的跨越。2026 年 9 月 20 - 21 日,上海物理智能与机器人研究院将主办‘PAIR Conference 2026’,设主题学术和商业闭门会议。

DeepTech深科技