「V*Bench」共找到 673 篇相关文章
ICML25 | 让耳朵「看见」方向!仅依靠360°全景视频,就能生成3D空间音频
空间音频技术成提升沉浸式体验关键,但现有技术未充分利用360°全景视频空间信息。OmniAudio研究可直接从360°视频生成空间音频,相关代码和数据集已开源,虽有局限但前景好。
神图刷屏,全网SaaS大佬彻夜难眠!AI吞噬全球软件业,2027现死亡交叉
马斯克转发发言称AI正在吞噬全球软件行业,一张图显示2027年AI市场与SaaS估值将现死亡交叉,标志SaaS衰亡。AI普及使初创公司蚕食大厂领地,Adobe等软件公司面临危机,SaaS形态或改变。
只有0.9B的PaddleOCR-VL,却是现在最强的OCR模型。
近期OCR赛道火热,作者应读者要求解读PaddleOCR-VL。它是百度PaddleOCR系列新模型,仅0.9B参数,在OmniDocBench v1.5评测多项领先。其架构高效,实测处理各类文档能力强,已开源。
The Batch: 884 | Transformer获得新能量
弗吉尼亚大学等机构的研究人员提出 Energy-Based Transformer(EBT),它能检查自身输出。训练时通过能量值优化预测概率向量,测试显示其泛化优但生成特定文本差,扩展性好,为高性能带来新可能。
谷歌深夜放出 IMO 金牌模型,多项测试力压 Grok 4、OpenAI o3!网友评论两极分化
昨夜谷歌向 Google AI Ultra 订阅用户推 Deep Think 功能,Gemini 2.5 Deep Think 模型获 IMO 金牌。它是多智能体模型,通过并行思维输出答案,在多领域及测试中表现佳,但网友评价不一。
长程任务飙升98%,斯坦福Skill原生LLM来了
普林斯顿、CMU、斯坦福、牛津等提出Skill-Native大模型,提出Skill Entropy度量技能切换难度,搭建Skill²-Bench评测,还将熵用作训练信号提出Skill-Entropy RL,提升多模型准确率,且技能熵可复用。
世界最强医疗模型百川M3发布:AI医疗,奇点已至
百川智能发布并开源全球最强医疗模型Baichuan - M3,各项指标SOTA且超越人类医生平均水平。它告别机械‘背医书’,学会主动追问、排查病因,解决AI‘胡说八道’问题,准确度超GPT - 5.2 - High。
DragonMemory:16倍语义压缩,为RAG应用瘦身
介绍GitHub项目DragonMemory,它针对RAG应用上下文压缩,核心是Dragon v7模型,从序列维度压缩,压缩比达16倍。本地测试效果好,有图形界面,支持多格式文档,开源但非成熟商业产品。
英伟达咽喉上的苏州人
英伟达供应链名单中,英诺赛科意外现身。它从珠海‘三无小作坊’起步,7年吸金60亿,成英伟达中国独家供应商。创始人骆薇薇回国创业,选IDM模式和8英寸工艺,带领公司成全球首量产8英寸硅基氮化镓晶圆企业。
马斯克首个编码模型上线,编程飙进Top5!这9位华人天团爆肝打造
xAI上线首个编码模型Grok Code Fast 1,速度快且性价比高,在编程基准测试中冲进前五。它全栈开发能力出色,背后核心团队华人学者占多半,xAI还给出提示词编写指南。