可验证推理」共找到 6105 篇相关文章

产品应用8

Claude Opus 4.7 发布!留给人类的时间,不多了

Anthropic 发布 Claude Opus 4.7,核心升级是让 AI 跑长且复杂任务,还能自我验证结果。它视觉能力超强,编程能力提升,新增 /ultrareview 功能,API 多了调节档,不过 token 数量或增加,成本能上浮。

AGI Hunt
新闻资讯7

Poe:DeepSeek使用率下降50%,快手崛起、OpenAI暴涨

2025年春季,Poe发布AI模型使用趋势报告。DeepSeek使用率降超50%,OpenAI因文生图功能暴涨。文本、视频、推理、图像和音频5大领域中,各模型表现不一,如快手Kling家族、谷歌Imagen 3家族等有亮眼表现。

AIGC开放社区
开源动态7

OpenAI 官方博客:用技能(Skills)加速开源项目维护

OpenAI用Codex改变维护OpenAI Agents SDK仓库方式,通过仓库本地技能、`AGENTS.md`文件和GitHub Actions,将工程工作变为重复工作流,提升开发效率,还介绍了配置、技能架构及使用注意事项。

宝玉AI
新闻资讯8

软件产品,集体向 Agent 缴械

2026年不到三个月,传统软件产品正主动成Agent「调用模块」。如Notion、Figma等纷纷支持。这是软件行业范式转移,不被调用的软件将被淘汰,竞争逻辑也改变。

特工宇宙
开源动态7

The Batch: 904 | 智能体全面释放

2025年11月开发者Peter Steinberger发布个人AI智能体OpenClaw,1月下旬在HackerNews提及后迅速走红。它完成多种任务,有独特工作方式和架构,但也存在安全漏洞,引发AI社群讨论。

DeeplearningAI
产品应用7

Cloudflare 通过左移安全实践扩展基础设施即代码

Cloudflare实施基础设施即代码和自动化策略执行,将安全验证前置,消除手动配置错误,在部署前捕捉安全违规。该方案以Terraform等为核心,还解决了采用难题、配置漂移等问题。

InfoQ
算法论文8

高保真、多控制集成于「统一画布」,组合式图像生成新范式!

Canvas - to - Image是新型图像生成框架,将多种控制方式整合到统一画布,用户直观操作生成高保真、多控制图像。它简化创作流程,解决了现有方法控制单一分散、交互性差的问题。

新智元
开源动态8

Meta开源首个320亿参数代码世界模型CWM

Meta FAIR发布320亿参数的研究模型Code World Model (CWM),用“世界模拟”方式处理代码,试图真正“理解”代码逻辑。它在Math - 500数据集测试成绩亮眼,模型权重开放,多渠道下载。

AI工程化
开源动态8

首个开源多模态Deep Research智能体,超越多个闭源方案

首个开源多模态Deep Research Agent登场,整合多种工具并优化决策。其WebWatcher技术方案覆盖全链路,实验中在四大核心领域领先主流模型,展现复杂推理和信息检索实力。

量子位
推荐文章8

浏览器里的 AI 革命:前端工程师的新战场

AI 进入浏览器和前端,JavaScript 扮演新角色。浏览器端 AI 崛起,能在本地提供智能服务。AI 增强 JS 应用,有多种工具支持,但也面临性能、模型尺寸等挑战,未来前景广阔。

InfoQ