「高级推理测试」共找到 3465 篇相关文章
Seedance 2.0之后,又一中国视频模型SkyReels-V4登上全球第二
昆仑天工发布SkyReels V4视频大模型,在Artificial Analysis Arena基准测试中排全球第二。它支持多模态输入、音视频同步生成等,采用独特架构与技术,经多阶段训练,有全新评估基准,表现出色。
国产模型编程能力卷到这个程度了?MiniMax-M2.5 深度实测
文章深度实测MiniMax-M2.5编程能力,用其开发多款游戏和点名工具,结果出色。还分析其底层技术,如原生Agent RL框架、过程奖励机制等,指出它性价比高,虽有不足但值得关注。
大模型桌游试玩员来了:用五大画像模拟「千人千面」,评分精准度超越GPT-5.1
盛大东京研究院等团队提出MeepleLM,首个能模拟玩家视角给出建设性批评的虚拟试玩模型。它构建专属数据集,引入MDA理论,提炼五种玩家画像。实验显示其评分精准度超GPT - 5.1等通用模型。
BigQuery 新功能:SQL 直调 17 万 + AI 模型,3800 万行数据处理成本仅 2 美元
Google为BigQuery推出面向开源模型的第三方生成式AI推理功能,允许数据团队用SQL语句部署运行Hugging Face或Vertex AI Model Garden的模型,消除对独立ML基础设施的需求,解决数据团队痛点。
像开发软件一样造世界,Agent2World来了,把世界模型做成可运行的符号环境
为让模型真正“能行动”,需可执行、可验证的符号世界模型,但现有自动生成路线有困局。研究团队提出 Agent2World,经实验验证有显著效果,能稳定产出高质量符号世界模型,开辟 AI 理解现实环境新可能。
0.005%参数量超越SOTA!提升模型能力无需庞大奖励模型
上海交通大学等校联合团队提出轻量级奖励模型SWIFT,利用大模型隐藏状态线性特征,仅训练极小线性层,在推理任务中超越主流奖励模型,实现计算效率与准确率双提升,且在多领域表现出色。
ChatGPT开始预测用户年龄,NSFW内容要来了!
OpenAI于1月20日更新推出年龄预测功能,通过分析用户多方面信息判断是否为18岁以下。网友测试发现猜测较准,这或使NSFW内容限制放宽,不同模型版本情况有别,更新还改进语音和记忆功能。
2026开年王炸模型MiroThinker 1.5实测:Google和GPT没做到的事,被它做到了
自媒体从业者实测开源模型MiroThinker 1.5,它不拼参数规模,注重去伪存真。在多场景测试中表现出色,如投资决策、内容查证等。其技术揭示大模型未来或在于外部交互,而非参数膨胀。
解锁任意步数文生图,港大&Adobe全新Self-E框架学会自我评估
香港大学与Adobe Research联合发布Self - E框架,可从零训练实现任意步数文生图。它改变训练范式,用两条互补训练信号,在GenEval基准表现出色,让文生图训练更灵活且具扩展性。
中美算力,站在2000亿美元的分岔路口
高盛报告称2025年全球人工智能投资规模或接近2000亿美元。中美算力发展站在分岔路,中国追性能,美国被能源限制。全球算力市场有新变化,中国本土芯片崛起,各方也在热议AI是否有泡沫。