可验证性」共找到 4926 篇相关文章

产品应用7

Claude Skills|将 Agent 变为领域专家

今年10月,Anthropic推出Claude Skills能力,在Claude多产品使用。它是向Agent注入内部知识的标准化方案,与MCP协同工作,还介绍了实现Agent Skills的方法及主动式智能导购AI助手构建。

阿里云开发者
算法论文8

SIGIR 2025 | 解决扩展和迁移难题,华为新加坡提出InstructRAG,提升高达19%

大语言模型任务规划面临扩展迁移挑战,华为新加坡团队提出 InstructRAG 方案,通过多智能体协同架构实现指令图扩展与少样本任务迁移,在多数据集测试中能提升高达 19.2%。

机器之心
产品应用7

视觉AI从「会生成」走向「能创作」,RabbitVis探索AI应用新范式

随着AI生图能力提升,如何让AI进入创作流程成新问题。兔展智能基于UniWorld - Design视觉AI大模型推出RabbitVis,推动视觉AI从图片生成走向编辑、交付的创作流程,解决创作流程断点问题。

机器之心
产品应用7

作为一个接过Aha单的YouTube博主,我来聊聊这个AI产品

文章指出当下AI Agent分化为通用型、生活服务型、开发者工具型和垂直行业型四类。以Aha为例,介绍其作为达人营销垂直Agent平台,在筛选达人、匹配合作、保障安全等方面的优势,还分析了适用与不适用的产品情况。

花叔
开源动态8

超越英伟达Describe Anything!中科院 & 字节联合提出「GAR」,为DeepSeek-OCR添砖加瓦

中科院与字节联合提出「GAR」,为构建自然图像的Dense Caption提供新思路。GAR具备精准描述、关系建模和组合推理能力,通过引入新组件,兼顾细粒度与全局上下文,在多测试集表现优异,且代码等已开源。

量子位
产品应用7

AI写代码终于不瞎烧钱了:边车路由让顶级能成本直降35%

传统模型路由用于写生产代码易掉链子,Cognition发布的Devin Fusion混合模型框架解决该问题。官方测试显示,它能降35%编码智能成本且质量无明显下滑,从实际测试案例看出其适用边界。

AI工程化
产品应用8

谷歌Gemini 3.1新模型深夜掀桌, 每秒狂飙363 token! 1/4价格暴击Claude

谷歌深夜推出Gemini 3.1 Flash-Lite,输出速度363 token/s,价格仅0.25美元/百万Token,跑分碾压GPT-5 mini和Claude 4.5 Haiku。开发者通过Google AI Studio体验,企业用户通过Vertex AI接入。

新智元
新闻资讯8

刚刚,阿里旗舰模型Qwen3-Max-Thinking发布,编程能力“踢馆”Gemini与Claude

阿里发布旗舰模型Qwen3-Max-Thinking,总参数超1万亿,在多项权威基准测试中表现优异,与顶级闭源模型竞争。千问团队为其引入两项核心创新,提升推理能,该模型已免费体验。

InfoQ
新闻资讯7

李飞飞发布全新世界模型

李飞飞团队的World Labs发布两款新模型Marble 1.1和Marble 1.1 - Plus,能将平面照片转化为3D世界、提升画面清晰度。二者各有侧重,前者重画质优化,后者重空间生成,官方建议新用户从1.1开始用。

量子位
新闻资讯7

固态电池量产了?谨防上当

年初CES展,芬兰Donut Lab公司发布全球首款“量产、用于实际车辆”的全固态电池,参数优秀到近乎诡异。但该公司团队无电池研发经验,且参数违背产业常识,量产固态电池或为骗局。

远川科技评论