「可验证推理」共找到 6164 篇相关文章
InfoDeepSeek:首个开放网络环境下的智能体信息搜寻质量评估基准
上海交通大学与华为诺亚方舟实验室联合推出InfoDeepSeek,它是首个评估真实动态网络环境下智能体信息搜寻质量的基准。该基准有挑战性问题、真实动态环境等亮点,还开展实验揭示智能体行为特性。
字节开源高效解析文档图像的新型多模态模型Dolphin,快速将复杂的文档图像转化为结构化数据。
字节开源新型多模态模型Dolphin,采用“先分析后解析”范式,能将复杂文档图像转化为结构化数据。它有卓越性能和多种特性,还提供安装、推理使用指南。
ICML 2025 Spotlight | 用傅里叶分解探讨图像对抗扰动,代码已开源
文章聚焦图像对抗净化,现有基于扩散模型策略在时域难解耦干净像素与扰动,损害图像语义。作者从频域研究,用傅里叶分解,发现扰动倾向破坏高频谱,提出注入低频信息,效果显著,论文与代码已开源。
北大校友,OpenAI前安全副总裁Lilian Weng最新万字博客文章:Why We Think
北大校友Lilian Weng新发布万字博文《Why We Think》,系统梳理让AI模型‘多想一会儿’的前沿方法及逻辑,深入剖析多种机制突破AI性能瓶颈的理论、技术与进展,还提出一系列待解决的开放性问题。
刚刚,OpenAI发布自主编码代理Codex,程序员的工作将被彻底颠覆?
OpenAI发布自主编码代理Codex,它能独立完成编程任务。与其他工具不同,它是面向任务的,允许并行工作。虽经强化学习微调,代码有“品味”,但有局限,如后续请求处理不佳,未完全集成工程环境。
CVPR2025|MCA-Ctrl:多方协同注意力控制助力AIGC时代图像精准定制化
中国科学院计算技术研究所团队提出无需微调的通用图像定制方法 MCA - Ctrl,利用扩散模型内部知识,结合条件语义与主体内容。实验显示其在编辑和生成任务表现优,解决了现有技术瓶颈。
毫秒响应延迟!开源统一语音对话模型Voila
Voila是开源统一语音对话模型,能以自发、实时且有情感的方式与人类互动。它采用全新端到端架构,响应延迟仅195毫秒,支持超百万种预构建声音,适用于多种语音应用。
MCP 已死?不,它正在进化:三个关键变化
本文针对网传“MCP已死”的说法,解读最新版MCP模型上下文协议的三大核心变化,对比MCP Tasks与A2A的区别,给出选型建议,帮助开发者适配企业级Agent场景需求。
Fable 5.1变身Token刺客,几分钟烧光额度!AI圈掀起「榨汁革命」
Anthropic发布的Fable 5.1虽性能强但极耗Token,引发开发者不满。当前AI产业面临算力饥渴与Token通胀问题,企业落地AI痛点多。迅策科技的TokenCloud平台能助力企业高效转化Token,还介绍了其配套产品TokenOS。
如果你的大学不提供 Token,应该立即退学
本文站在学生角度探讨 AI 时代大学生学习问题。认为高校在 AI 教育上滞后,不提供 Token 不合理。强调学生应善用 AI,具备问题意识、判断力和品味,还给出了使用 AI 的具体建议。