「多模型调度」共找到 9763 篇相关文章
国产开源LLM迎来大爆发的一周:Kimi、腾讯、快手、美团、面壁智能
国产开源大模型迎来爆发,快手、月之暗面、美团、面壁智能、腾讯等接连发布新模型,如快手Keye-VL - 1.5 - 8B刷新视频理解SOTA,美团LongCat - Flash - Chat推理快成本低等。
推理正确率下降65.5%!斯坦福、MIT等用「不等式」拷问AI逻辑极限
大语言模型在数学证明常现推理漏洞,斯坦福等高校团队提出IneqMath基准评估其严谨性。用不等式证明题切入,拆解为子任务,构建评测体系,用LLM - as - Judge审查。结果显示模型推理正确率低,存在结构性缺陷。
维纳智能登上Nature通讯:AI不只会回答问题,开始生成高精度行业数据
维纳智能登上Nature通讯,其让大模型自动生成高精度推理数据,用闭环反馈驱动专业Agent自主演化。该公司在多领域交出工业级精度答卷,还解决了Agent泛滥的困局,推出多款创新产品。
千万级标注成本归零!CVPR 2025清华团队成果:相机的“自运动”就是最好的老师
以往空间音频模型受限于采集条件和标注成本,清华和密西根大学团队在CVPR 2025给出新路径,利用相机自运动作监督信号,让模型从互联网视频学三维空间音频感知,成果入选会议Highlight。
阿里又放大招!一句话,造一个能走进去的世界
阿里上线HappyOyster 1.0世界模型,一句话生成可实时探索、交互的开放世界。它与文生视频不同,能让用户参与体验。该模型有世界探索和实时导演两大功能,技术优势显著,应用场景广泛。
林俊旸果然创业了!一个“Qwen负责人”头衔值135亿
前阿里千问大模型负责人林俊旸离职后创业,种子轮目标估值20亿美元。他曾深度参与阿里多个大模型项目,离职首篇长文提出“Agentic Thinking”,或为创业方向。
追剧不断网,可能背后有个AI在加班,故障诊断准度破91.79%
中兴通讯和中国移动团队针对电信网络故障诊断难题,提出 TN - RCA530 基准和 Auto - RCA 框架。测试多个大模型,初始准确率低,经框架优化后,Gemini - 2.5 - Pro 准确率从 58.99% 升至 91.79%,超人工水平。
The Batch: 978 | DeepSeek-V4-Pro 更新了
DeepSeek发布旗舰模型DeepSeek-V4-Pro-0813正式版,性能提升,还发布开源agent harness开发者预览版并提价。模型在多指标表现佳,编码能力改进明显,公司公开基准测试框架意义大。
完全免费!Claude Science开源平替,DeepSeek/GLM想用哪个用哪个
Anthropic发布面向科学家的AI工作平台Claude Science,能集成科研工具、多智能体协作等,但有系统、付费和模型使用限制。YC孵化团队推出开源平替OpenScience,不绑定模型厂商,功能更丰富且安装简单。
Nano Banana 拉爆谷歌营收创纪录,劈柴哥开心坏了!幕后团队曝内部“绝对优先事项清单”
谷歌凭借Nano Banana功能让Gemini应用月活达6.5亿,单季营收破千亿。Nano Banana由多团队融合能力打造,引发全球热潮,吸引年轻和国际用户。文中还探讨其诞生、传播原因及图像编辑未来,提及谷歌发展规划。