「跨领域数据」共找到 4172 篇相关文章
AI视频生成走向“演技生成”时代,生数科技Vidu全球发布Vidu Q2 | 甲子光年
9月25日,生数科技全球上线新一代图生视频大模型Vidu Q2,实现从“视频生成”到“演技生成”跨越。它在表情生成、运镜、语义理解、时长选择等方面有提升,分闪电和大片模式,已在多端上线。
5.8K Star爆火!!在终端里开网页、刷视频、玩游戏,这操作真绝了!
介绍开源工具`term.everything`,它能在终端运行任何GUI应用,像浏览器、游戏等。该项目在GitHub获5.8K star,支持X11和Wayland应用,可远程使用,但画质和性能有局限。
比思维链准43%!逻辑脑+大模型直觉,推理可靠性大幅提升
中德研究团队发布成果,给大模型外挂「逻辑脑」,结合答案集编程与LLM,构建神经 - 符号框架,提升空间推理准确率,让AI能说清逻辑、跨任务迁移,迈向更可靠的通用推理。
登顶多模态推理榜MMMU!UCSD新方法超越GPT-5、Gemini
加州大学圣地亚哥分校团队开发的DreamPRM-1.5在MMMU测评榜夺冠,超越GPT-5、Gemini 2.5 Pro Deep-Think。它细化加权粒度到样本,有Instance Table和Instance Net架构,采用双层优化与生成式奖励模型。
史上最大升级!7亿周活ChatGPT逼宫,谷歌慌了,这次要把AI整个塞进Chrome
Chrome迎来史上最大AI升级,谷歌将大模型Gemini全面接入,从内置AI助手到安全防护等多方面改写使用范式。谷歌急于部署,因ChatGPT周活达7亿,AI重塑上网体验,谷歌有危机感。
腾讯混元开源AI绘画新框架:24维度对齐人类意图,让AI读懂复杂指令
腾讯混元团队开源PromptEnhancer框架,通过“思维链提示重写”提升AI绘画文本 - 图像对齐精度,复杂场景准确率提升17%以上。还开源高质量基准测试数据集,为研究提供支撑。
超越90%城市规划师!清华、MIT等提出人机协作新范式 | Nature子刊
清华大学联手MIT等机构提出「大语言模型+规划师」新框架,让AI作「智能规划助手」。框架含概念设计、方案生成、效果评估三阶段,实验显示AI表现超九成人类规划师,未来将人机协同。
邱锡鹏老师团队发布VehicleWorld:让智能汽车真“智能”
邱锡鹏老师团队发布论文,构建高度仿真的智能座舱虚拟环境VehicleWorld,并提出基于状态的函数调用(SFC)方法。实验显示,SFC大幅提升任务执行准确率和效率,还构建了Vehicle Benchmark进行评估。
挑战Claude4的8B Agent!NUS提出AgenTracer:面向多智能体系统的失败归因
随着大语言模型发展,多智能体系统潜力大但失败率高。新加坡国立大学等机构研究者提出AgenTracer框架,构建标注管线、设计轻量级追踪器,在失败归因任务上超大型闭源模型,还能助力系统自我提升。
长视频生成可以回头看了!牛津提出「记忆增稳」,速度提升12倍
牛津大学团队提出VMem,把「看过什么」写进几何小片,用基于3D几何的记忆索引替代短窗上下文,实现「一致性更强、资源更省、速度更快」,实测速度比常规管线快约12倍。