推理评测」共找到 2557 篇相关文章

开源动态8

8B模型任务击败GPT-5?阶跃星辰开源Deep Think新框架,小模型解锁百万Token测试时计算

阶跃星辰推出并行协同推理框架PaCoRe,让大模型突破上下文窗口和处理速度限制。基于此框架,小模型能解锁百万级Token测试时计算。PaCoRe - 8B在数学基准测试中超越GPT - 5,还具备前沿性能、“综合”能力涌现等优势。

机器之心
新闻资讯7

OpenAI夺金IOI,但输给3位中国高中生

OpenAI官宣其推理模型在今年IOI线上竞赛中成绩刷新纪录,总分533.29,全球330名人类选手中排第六,AI参赛者中居首。不过其没比过三位中国高中生。此前OpenAI称模型获IMO金牌引争议,此次网友更谨慎。

量子位
算法论文8

把事实核查嵌入诊疗流程:MedGuard给「诊疗安全」当守门人

蚂蚁AI安全实验室与厦门大学团队联合提出MedGuard,将医学事实核查嵌入诊疗流程。它是医疗安全基础设施,在诊疗意见等形成前验证事实,在评测和临床评价中表现突出,能准确判断风险边界,可嵌入医疗流程。

机器之心
算法论文7

腾讯LLM团队:对下一个 Token 预测的深入剖析,多样性 or 精准度?

最新研究证实RL能增强LLM推理,但成效受限预训练token分布。腾讯LLM部把交叉熵重写成单步策略梯度,用超参压熵,为RL打造‘低熵高信号’起点,经实验验证低熵模型优势明显。

PaperAgent
新闻资讯8

百川开源医疗大模型 M3,王小川:今年会发布两款 ToC 产品,正在做硬件

1月初OpenAI、Anthropic推出医疗产品,百川智能也开源医疗大模型Baichuan - M3,评测成绩突出。王小川表示今年会发布两款ToC产品,还在做硬件,阐述了百川在医疗领域的目标与策略。

Founder Park
新闻资讯8

Runway Gen-4.5刷屏发布,把重量、尘土和光影都做对了,网友:颠覆

Runway Gen-4.5突袭发布,获“视频生成AGI时刻”评价,在Artificial Analysis测试中拿下SOTA。它能精准执行复杂指令,物理还原与视觉精准度强,官方将逐步开放使用权限,还直言其存在因果推理等局限。

量子位
开源动态8

图像界的DeepSeek!12B参数对标GPT-4o,5秒出图,消费级硬件就能玩转编辑生成

Black Forest Labs开源旗舰图像模型FLUX.1 Kontext[dev],专为图像编辑打造,能在消费级芯片运行。12B参数少、推理快,性能媲美闭源模型。有诸多特点,经优化训练,在KontextBench基准表现优。

量子位
算法论文7

720美元套出A社死藏的Opus原始思维链,还是Haiku泄露的,GPT/Gemini也中招

研究人员发现,将大模型返回的加密推理块扔给同厂小模型让其复述,就能破解大模型隐藏的思维链。如Anthropic、OpenAI、Google的模型均中招,还会带来隐私、安全等风险,虽已打补丁,但仍有难题。

量子位
推荐文章7

大模型是不是到顶了?瓶颈到底在哪

文章探讨大模型是否到顶,指出‘到顶’争论分三个问题,靠堆大模型提升能力之路变平,受数据和成本约束。但大模型还有后训练和推理时计算两个发展方向,未来进步或来自更会用算力。

AI Reading Hub
新闻资讯8

GPT-5.5全球首破!0源码盲写程序,编程AI进入新纪元

全网AI交白卷的ProgramBench编程基准,被GPT-5.5首破。它能0源码盲写程序,同一题用C和Python两种解法通过测试。相比之下,Opus 4.7表现不佳。这揭示推理算力成编程AI核心变量。

新智元