多选题评测」共找到 4556 篇相关文章

算法论文7

The Batch: 896 | 教会模型说出真相

大型语言模型有时会隐瞒未遵守约束条件的事实。研究人员微调 GPT - 5 Thinking,使其违规时能‘自白’。通过强化学习训练,测试显示微调模型在评测能承认问题,自白机制可监控模型行为。

DeeplearningAI
产品应用8

华为云的组合新范式,引爆了Agentic AI应用革命

在2025全球计算大会上,华为云提出Versatile智能体平台与CloudDevice云终端协同方案,致力于破解大模型行业落地痛点。该方案激发AI端侧应用可能,释放云端潜力,已在行业展现变革价值。

机器之心
新闻资讯8

全球第一!我国又一家芯片企业硬核出世

本文介绍了我国氮化镓芯片企业英诺赛科,其创始人骆薇薇回国创业,采用IDM全产业链模式制造8英寸晶圆。公司攻克核心技术,量产8英寸硅基氮化镓芯片,在领域应用,营收增长,还打赢专利官司走向全球。

芯师爷
产品应用7

阿里老兵造出会说话的迪迦!AI玩具单品20万销量,红杉等2亿A轮抢投

跃然创新推出全球首款迪迦奥特曼AI玩具,完成2亿A轮融资。其首代产品BubblePal销量达20万台。新品改进诸不足,优化体验,强调安全。公司瞄准AI Friend,未来产品分儿童和成年线。

量子位
开源动态7

以小博大,仅1.7B媲美gemini2.5-pro,达到SOTA文档解析性能

dots.ocr是语言开源文档解析器,把布局检测和内容识别统一在视觉语言模型中,虽LLM仅1.7B参数,却达SOTA性能。介绍了其预训练三阶段及SFT阶段关键策略。

PaperAgent
开源动态8

python打造Google(A2A)+MCP,Langchain生态互补

文章介绍Google的Agent2Agent(A2A)协议,它能实现AI代理通信协作,打破平台孤岛。还提及MCP协议,二者互补。重点介绍python - A2A库,它实现A2A规范,与框架、模型集成,给出实战示例。

CourseAI
开源动态7

闭源RSI的严父来了:18个Agent自主科研,Kimi K3靠Harness逼近Opus 5

开源AI基础设施公司Prime Intellect研究表明,借助智能体Harness,让开源模型负责监控和实现,可让‘AI开发AI’更便宜、效果更好。实验中,Kimi K3搭配Harness逼近Opus 5。

量子位
算法论文8

TRM思考奖励模型上线,大模型推理质量终于能量化了 | ICML‘26 Oral

大模型推理评测只看答案,忽略推理过程。上海校团队提出TRM,用ME² principle刻画推理质量,DAG-based pairwise evaluation还原结构,训练奖励模型,让推理质量可度量、训练和优化。

量子位
新闻资讯7

每周产业洞察 | 2026,AI视听内容的“下半场”比的是“控制力”?

北京AIGC视听产业创新中心位于朝阳区东坝乡,由方参与,采取‘共创、共建、共享’模式,提供六大服务平台。截至2025年8月汇聚近百家生态伙伴,首创郎园负责运营,携手企业构建产业链生态。

郎园Station
产品应用8

18个月,中国Token消化狂飙300倍!别乱烧钱了,清华系AI Infra帮你腰斩API成本

中国大模型API服务碎片化、“黑盒”问题严重,成本高。清程极智1月29日发布AI Ping,类似“中国版OpenRouter + Artificial Analysis”,可评测、路由大模型,帮开发者降低成本、提升效率,还能重塑服务市场秩序。

机器之心