「输出质量」共找到 903 篇相关文章
The Batch:836 | 基准测试成本攀升
独立AI测试实验室披露评估推理模型成本上升。这些模型生成“思维链”提升输出质量,但计算需求增加,成本上升使资源有限组织难复现结果,且新模型定价、按需分配推理token也让成本更复杂。
CEO让AI定裁员名单:被它反驳时,我选择怀疑自己!
Confluent报告显示,62%英国高管用AI辅助决策,27%用其处理人事。88%称决策更快、83%表示压力更小,但65%认为决策不协作,70%与AI意见相左时会怀疑自己,数据质量也影响决策。
实时交互式长视频生成
文章提出用于实时交互式长视频生成的帧级自回归框架 LongLive,解决了长视频生成在效率和质量方面的挑战,具备长视频生成、实时推理、高效微调等亮点,还给出安装、推理、训练等步骤。
思维链可无限延伸了,MIT等打破大模型上下文天花板
MIT等机构提出新架构Thread Inference Model(TIM),配合专用推理引擎TIMRUN,把推理过程变为树状递归子任务结构并修剪子任务,让模型突破输出窗口限制实现长程推理,实验验证了其性能。
Karpathy又双叒叕发新概念了,这次我替你找到了那个产品
Andrej Karpathy提出将LLM算力用于建知识库,引发关注但搭建有门槛。网易有道新出的有道宝库功能类似,能自动理解整理资料,有追问、多模态输出等功能,还打通翻译链路,目前免费内测。
V0 模型直接进驻 Cursor,UI 生成效果炸裂,氛围编码体验再升级。
AI 编码赛道竞争激烈,Vercel 的 V0 发布 AI 模型,可在 Cursor 中使用,还推出新工作流提升 UI 生成效果。文中介绍了 V0 特点、Cursor 设置方法及使用演示,还分析了 Vercel 自研模型的原因。
从零开始玩转循环 (Getting started with loops)【译】
Claude Code团队将“循环”定义为AI智能体不断重复执行工作周期,直至满足预设停止条件。文章介绍了回合制、目标导向、基于时间和主动式四种循环类型、适用场景及控制token消耗方法,还给出保证代码质量的原则。
社区供稿丨迈向AI4S 2.0,上海AI实验室开源书生万亿科学大模型Intern-S1-Pro
2月4日,上海人工智能实验室开源万亿参数科学多模态大模型Intern - S1 - Pro,为AI4S迈向2.0时代提供开源基座。其核心能力跃升,架构创新,协同通用与科学能力,还构建‘算力 - 算法’基座,高质量开源赋能生态。
刚刚,DeepSeek-V3.1「终极版」重磅发布!最大提升超36%,V4/R2还远吗?
DeepSeek最新模型DeepSeek-V3.1-Terminus发布,解决了此前输出随机带「极」字、中英文混杂等问题,在多个基准测试中成绩提升,最大提升超36%,Agent能力也有进步,还引发网友对V4/R2的期待。
通义实验室正式开源 Mobile-Agent v3.5 及新一代多平台 GUI Agent 基座模型 GUI-Owl-1.5
通义实验室正式开源 Mobile - Agent v3.5 及新一代多平台 GUI Agent 基座模型 GUI - Owl - 1.5。该模型有多档参数可选,分 Instruct 和 Thinking 版,支持多平台。它解决了高质量数据难搞定等痛点,评测表现良好。