推理之王」共找到 2707 篇相关文章

算法论文8

腾讯混元团队最新研究:让 AI 从「固定模型」走向「实时适配系统」

腾讯混元团队提出论文《HY-WU (Part I)》,尝试让模型在推理阶段根据输入实时动态生成适合任务的参数,而非依赖固定参数。通过多类实验验证,这种方式在图像编辑等任务中有明显优势,还降低了训练复杂度。

AI科技评论
开源动态8

7B模型对标GPT-4o,全球首个医疗代码生成大模型训练平台来了

研究团队发布全球首个医疗代码生成大模型训练平台MedAgentGym,提供评估基准和训练生态,提升大模型医疗代码生成与推理能力。经其训练的Med - Copilot - 7B达GPT - 4o相当水平,解决医疗AI编程瓶颈。

量子位
新闻资讯8

刚刚,OpenAI前CTO Mira Murati公司Thinking Machines Lab发文,揭开了大模型不确定性的真相

OpenAI前CTO Mira Murati创立的Thinking Machines Lab推出研究博客Connectionism,首篇文章聚焦LLM推理的非确定性问题。研究发现真正原因是批次不变性缺失,提出实现批次不变内核的方案,实验效果显著。

AGI Hunt
新闻资讯7

ClockBench:一个简单的钟表测试让AI全线溃败

ClockBench测试让11个多模态大模型与5个普通人认钟表时间,人类平均准确率89.1%,最好的AI仅13.3%。AI在复杂钟面表现差,却能处理抽象指令。该测试暴露视觉AI空间推理缺陷,对评估有启发。

AI工程化
开源动态7

美团也开源了大模型,但我觉得他们的野心是通用生活Agent。

美团发布并开源560B参数的MoE模型LongCat - Flash - Chat,推理速度快。与DeepSeek V3对比,输出速度优势明显。美团多个落地或内测AI功能服务C端生活场景,目标是打造通用生活Agent。

数字生命卡兹克
新闻资讯7

GPT-5通关《宝可梦水晶》创纪录!9517步击败赤爷,效率碾压o3三倍!

GPT-5通关《宝可梦水晶》创纪录,仅9517步击败赤爷,步数为o3的三分一。它在主线任务效率也远超o3,如收集徽章、对战四天等。其优势在于幻觉少、空间推理和目标规划能力强。

量子位
算法论文7

Theory of Agent:构造知行合一的智能体

当前AI(如ChatGPT)存在行为随机性、效率黑洞等问题,论文指出AI缺乏认知地基,需明确认知框架。还提出革命性等式“推理 = 行动”,分析了知识与决策边界,给出最优行为四象限,介绍落地路径和未来发展方向。

深度学习自然语言处理
推荐文章7

画图 Prompt 两则

作者李继刚分享画图 Prompt 两则。因 Gemini Nano banana pro 画图风格太‘AI’,提出注入指定风格解腻,介绍了生成 Swiss 风格《鬼灭刃》继国缘一战斗特写及日系下雪天初恋男女操场玩闹写真海报图的具体要求。

李继刚
开源动态8

8B模型任务击败GPT-5?阶跃星辰开源Deep Think新框架,小模型解锁百万Token测试时计算

阶跃星辰推出并行协同推理框架PaCoRe,让大模型突破上下文窗口和处理速度限制。基于此框架,小模型能解锁百万级Token测试时计算。PaCoRe - 8B在数学基准测试中超越GPT - 5,还具备前沿性能、“综合”能力涌现等优势。

机器之心
7

杨植麟预告,Kimi K3要来了

暗面团队海外AMA透露Kimi K3相关信息。K3或采用KDA架构,有低成本优势;通过开源解决信任问题;将推出不同规格模型;产品打磨注重写作、视觉能力及NSFW内容探索。Kimi性价比模式或改写行业规则。

AI产品自由