「Adaptive Reasoning Model」共找到 191 篇相关文章
RL 是新的 Fine-Tuning
今年 9 月,Thinking Machines 研究使 LoRA 重获重视。OpenPipe 创始人 Kyle Corbitt 访谈指出,多数场景微调 ROI 低,RL 将融入 agent 生命周期成主流,但 RL 落地难在环境搭建,World Model 或为关键。
黄仁勋100万亿预言兑现!易鑫Voice Agent落地,汽车金融迎效率革命
2024年GPT - 4o问世后,Voice Agent创业公司涌现,但通用方案在金融等场景「水土不服」。易鑫深耕汽车金融,自研工业级Voice Agent系统,采用Model + Harness方法论,实战数据亮眼,还将向泛金融领域延伸。
刚刚,DeepSeek 文档更新,Agent 开发者要注意这个字段
DeepSeek在官方API文档给出thinking mode和tool call结合样例,把模型中间思考过程成Agent系统需管理部分。关键字段`reasoning_content`从调试信息成协议流程一部分,影响状态管理、多模型适配等。
超越GPT-4o!华人团队新框架让Qwen跨领域推理提升10%,刷新12项基准测试
加拿大滑铁卢大学与TikTok新加坡的华人团队提出全新训练框架General - Reasoner,让Qwen系列大模型跨领域推理准确率提升近10%,在多项基准测试中超越GPT - 4o。该框架有全领域推理数据集和生成式答案验证器两大创新。
微软深夜发布SambaY架构,Phi-4min加速10倍推理
微软基于Phi-4-mini版本,针对特定推理任务微调出Phi-4-mini-Flash-Reasoning 3B模型,将其扩展到200064 tokens。采用新型SambaY架构,支持64K token上下文长度,运行快10倍,有诸多优点。
清华上交满分论文证明:强化学习并不能让大模型更会思考!
清华和上交在NeurIPS 2025的研究《Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?》获满分。研究聚焦RLVR,发现强化学习不能让大模型更会思考,推理能力上限仍由基础模型决定。
特斯拉终于着急了
特斯拉交出史上最差季报,净利润暴跌、汽车收入骤降。其处于从汽车向人工智能转型过渡期,却面临汽车业务疲态、AI业务落地难的问题,如Cybertruck和Model 2/Q未达预期,资本市场耐心受考验。
关于GPT-5 API
文章虽指出GPT - 5未达AGI,先前宣传过度,但亮点颇多。介绍了三个模型定位、输入输出、价格速率等差异,还提及新参数和功能,如`reasoning.effort`、`verbosity`等,新特性助开发者平衡成本、速度和效果。
苹果重磅官宣谷歌Gemini 将支持 Siri,OpenAI 被边缘化?马斯克比奥特曼还急:这不合理!
苹果和谷歌达成多年合作协议,下一代 Apple Foundation Models 将基于谷歌 Gemini 模型及云技术构建,为 Siri 等功能提供核心支持。此合作引发行业讨论,马斯克质疑权力集中,也影响了 OpenAI 在苹果生态的角色。
突破遥操瓶颈!全新无本体数据世界动作模型Noe-0发布
穹彻智能发布世界动作模型 Noe - 0,全链路采用无本体采集数据。其数据来自真实环境,配合 World Action Model 架构和 AI - Native 数据基础设施,跑通从真实世界经验到机器人能力转化的完整链路,是具身智能的里程碑。