推理严谨性」共找到 2484 篇相关文章

新闻资讯7

我在OpenAI修中文

OpenAI研究科学家陈博远介绍GPT Image 2官网博客花絮,分享模型训练、测试情况,还展示亲手制作的官网图片,包括中文彩蛋、漫画、杂志页等,体现模型文字渲染、视觉推理等能力。

机器之心
新闻资讯7

Docker 通过 Cagent 提供 AI 代理确定测试

AI 代理系统普及,工程团队面临测试概率输出的挑战。Docker 的 Cagent 是一种 AI 代理确定测试方法,采用 proxy - and - cassette 模型,虽处早期,但揭示了 AI 代理测试的不同方向。

InfoQ
新闻资讯7

LeCun离职后不止创一份业!押注与大模型不同的路线,加入硅谷初创董事会

离开Meta后,Yann LeCun创立AMI,还加入Logical Intelligence任技术研究委员会主席。该公司推能量 - 推理模型,与主流大模型路线不同,其Kona模型在数独测试上表现远超大模型。

量子位
算法论文8

LeCun力荐的JEPA杀入LLM,用CV的思路训练LLM,能鲁棒双丰收

LeCun团队提出LLM - JEPA,将JEPA自监督学习架构从视觉扩展到LLM。它能提升能和鲁棒,在多模型和数据集验证有效,但有训练开销大、泛化不足等局限。

机器之心
新闻资讯7

吴恩达:图灵测试不够用了,我会设计一个AGI专用版

AI大神吴恩达2026年要做新的图灵-AGI测试,弥补AGI定义无统一标准、现有基准测试易误导大众的空白。该测试聚焦AGI经济和实际产出,能更好衡量AI通用能力。

量子位
新闻资讯7

20岁拿下博士、答辩席坐着费曼的狂人:AI是第一种「外星智能」

Stephen Wolfram是Mathematica等的创造者,他认为AI是巨大不可约机器,有计算不可约,是“外星智能”。Hugging Face被GPT - 5.6 Sol入侵印证其观点,他还提出新控制方式。

新智元
推荐文章7

为什么只有人类雌有月经?

月经并非人类独有,但极其罕见。人类进化出侵入强的血绒毛膜胎盘,子宫需自发脱膜化做准备。因母胎冲突,内膜有防御筛选机制,没受精卵着床时内膜只能出血脱落,即月经。

昆明走进自然户外
算法论文7

Anthropic 新研究:AI出错是“热混乱”

Anthropic研究团队发现AI可能无一致目标,只是瞎搞。他们将AI错误分类,测试发现推理越久越混乱,大模型复杂任务易失控。此发现改变对AI风险的认知,论文已在arXiv发布。

AI工程化
算法论文8

大语言模型逻辑评估

现有归因问答评估方法有‘归因短视’问题,研究团队提出 LOGICSCORE 框架,从三维度量化推理质量。在多数据集测试多款 LLM,发现专有、开源模型等存在不同逻辑问题,还分析典型逻辑错误。

深度学习自然语言处理
开源动态8

刚刚,字节开源Seed-OSS-36B模型,512k上下文

深夜,字节跳动Seed团队开源Seed-OSS系列模型,含三个版本。其用12万亿tokens训练,在多基准测试表现出色。有灵活推理预算控制等特,原生支持512K上下文窗口,基准测试成绩佳。

机器之心