推理可解释性」共找到 5628 篇相关文章

开源动态8

超越O4-mini,多模态大模型终于学会回头「看」:中科院自动化所提出GThinker模型

现有多模态大模型在通用场景推理有瓶颈,缺乏对视觉线索校验与再思考能力。中科院自动化所提出GThinker模型,有创新的「线索引导式反思」模式,经两阶段训练,性能超O4 - mini,论文等已开源。

机器之心
新闻资讯7

GPT-6 Astra:欢迎来到 AGI 时代。

OpenAI 发布 GPT - 6 Astra,总裁称开启 AGI 时代。演示视频展示其强大并行处理能力,跑分有争议,成绩不一。它有诸多成果和安全表现,也有监控性降低问题,发布过程却状况百出。

AGI Hunt
算法论文7

60%情况下,主流大模型没理解风险只是装懂!别被模型的“安全答案”骗了

研究发现超60%案例中主流推理模型生成合规答案却未真正理解风险,存在系统性漏洞。淘天集团团队引入“表面安全对齐”术语,推出Benchmark研究该现象,还介绍了数据集生成流程及评测指标。

量子位
开源动态8

最强开源搜索再升级,研究、预测能力实测超惊艳!

MiroMind团队发布新一代模型MiroThinker-1.7和MiroThinker-H1,定位为重型推理智能体。其研究能力强、推理靠,还能生成网页报告。新版本升级显著,靠两项关键技术实现有效交互,且预测案例表现出色。

开源先锋
产品应用7

AI 写代码老出错?Code Rabbit 来给 Cursor 当“纠错教练”,边写边改。

Cursor的AI Agent写代码虽强但易出错,Code Rabbit当“纠错教练”。它本用于审查GitHub PR和commit,现推出VS Code、Cursor等插件,能分析代码改动、提建议,与Cursor配合减少bug。

AI进修生
开源动态8

Altman 投的 Agent 终端 Warp 开源了,15小时Star 数飙到3.5万!开源是延长软件寿命的最佳方式

由 Sam Altman 支持的现代终端 Warp 正式在 GitHub 开源,OpenAI 成新代码库创始赞助商。Warp 团队认为传统开发模式遇瓶颈,开源汇集全球创意,还在功能上开放,引发社区热议。

InfoQ
开源动态7

里程碑!Artificial Analysis:Mac能跑的两款开源模型正式追上GPT-5

据Artificial Analysis报告,32B以下开源模型比肩GPT - 5。Qwen3.5 27B、Gemma 4 31B分别与GPT - 5中杯、小杯智能水平相当,虽知识全面性落后,但智能体表现和批判性推理进步大,硬件门槛低。

AI寒武纪
开源动态7

Wan2.2-Animate又火了,5分钟让抠脚大汉秒变高冷女神。

阿里开源模型Wan2.2 Animate又火了,用照片和视频就能生成换脸视频,表情动作复刻佳。它上限高,还能变声,用于舞蹈视频、影视二创等,但手指易崩坏。模型开源,有积极意义也有风险。

数字生命卡兹克
推荐文章8

投奔小扎,Jason Wei连发两篇博文公布“屠龙术”:一个公式看透AI,一条心法指引人生

OpenAI研究科学家Jason Wei被小扎挖走后连发两篇文章。一篇提出“验证者定律”,指出训练AI解决任务难易与验证性成正比;另一篇从强化学习悟到人生要走On - Policy路线,发挥自身优势。

AI寒武纪
开源动态7

Google Design.md:一键复刻60+大厂设计规范 | 设计界的事,能叫偷吗?

今天分享Google Stitch团队提出的DESIGN.md标准,单文件搞定网页设计。62个真实网站视觉语言对应的DESIGN.md在https://getdesign.md/获取,它也是开源项目。放入项目根目录后,AI编程助手读取生成风格一致的UI组件。

AI进修生