上科大」共找到 6393 篇相关文章

算法论文7

模型刷数学题竟有害?CMU评估20+模型指出训练陷阱

CMU团队评估20多个模型,发现只有强化学习(RL)训练的模型能将数学推理技能广泛迁移到其他任务,监督微调(SFT)训练的模型迁移有限甚至无迁移。研究还探索差异原因,表明RL微调更具优势。

量子位
算法论文8

首篇WebAgents综述:模型赋能AI Agent,实现下一代Web自动化

互联网任务重复繁琐,香港理工学研究人员从架构、训练和可信性等角度,总结WebAgents代表性方法,梳理研究进展。WebAgents能根据用户指令完成网页任务,其发展预示人机关系新纪元。

新智元
算法论文8

团队直击模型高分神话:人类90分,最强模型仅49分

南京学傅朝友团队在Google Gemini评测团队邀约下推出视频理解新基准Video - MME - v2。它有创新的分层能力体系与组级非线性评分,经超3300人工时标注。评测显示模型与人类差距,还揭示传统Acc指标虚高、‘Thinking’并非总增益等现象。

新智元
算法论文8

o1之后下一个范式?隐式CoT突破,让推理不再「碎碎念」

文章推荐 Implicit Chain-of-Thought 的最新进展 SIM-CoT,它直击隐式 CoT 核心痛点,用辅助解码器让隐式推理可解释。推理零额外开销,效果猛,研究已中稿 ICLR 2026,论文等均已开源。

机器之心
新闻资讯8

模型全面爆发,所有榜一都是Gemini!谷歌一夜站到了台前

北京时间今日凌晨,Google I/O 2025 开发者会开启。谷歌发布或升级系列 AI 工具与服务,如升级 Gemini 模型、推出编程智能体 Jules 等,还展示视频图像生成模型、搜索与购物模式升级,展现其在 AI 应用领域强势回归。

机器之心
新闻资讯7

最新!OpenAI:GPT-5将实现统一,Codex最佳实践是这样的

OpenAI Codex在Reddit AMA活动中,核心负责人围绕先推云端代理、GPT - 5与Operator整合等问题给出路线图。如Codex - 1预览情况、CLI设计、使用场景、安全模型、接入计费及API生态等方面都有说明。

AI寒武纪
产品应用7

这家意利公司想让机械臂飞太空,在轨道打印航天器

Caracol是意利工业级增材制造公司,以机器人手臂为支撑,配合自研挤出头与软件生产工业部件。其产品能幅缩短生产周期、降低成本,2025年融资、收购、扩产,还参与太空项目,探索具身智能。

DeepTech深科技
开源动态7

推出 AnyLanguageModel:在 Apple 平台统一本地与远程语言模型的 API

语言模型是构建现代软件的重要工具,但 Apple 平台开发者集成模型困难。Hugging Face 发布 AnyLanguageModel,是 Swift 包,可替代 Apple Foundation Models 框架,支持多模型服务商,降低使用 LLM 难度。

Hugging Face
新闻资讯7

从 Hadoop 到 Kubernetes:Pinterest 在 AWS EKS 的可扩展 Spark 架构

Pinterest将基于Hadoop的数据平台替换为Moka,这是在AWS EKS运行Spark的Kubernetes原生系统。Moka实现容器化作业隔离,支持ARM实例,改进调度、简化部署,降低成本、提高效率。

InfoQ
算法论文8

多模态模型,真的「懂」世界吗?——揭秘 MLLM 的核心知识缺陷

ICML 2025高分论文揭示MLLM核心认知盲区。研究发现主流MLLM缺乏核心认知能力,且不能靠规模扩展自然习得。作者构建测评体系CoreCognition,提出干预测试方法Concept Hacking,还给出关键发现与启示。

机器之心