「工作成果验证」共找到 2372 篇相关文章
大模型「越用越快」!SpeedupLLM首次验证,大降56%推理预算
Emory大学研究者提出SpeedupLLM框架,利用动态计算资源分配和记忆机制,使LLM处理相似任务时推理成本降56%、准确率提升,论文系统性验证了LLM“越用越快”,为AI模型发展提供新思路。
她们估值840亿,刚发了第一个AI成果
估值超120亿美元的Thinking Machines发布首篇研究博客,由创始人、OpenAI前CTO Mira Murati宣发。研究聚焦克服大语言模型推理中的不确定性,探讨推理结果难复现的根源,还介绍解决办法并验证效果。
WorkBuddy上线远程控制,国内也有了最丝滑的Agent工作方式。
WorkBuddy更新远程控制功能,因国内直连,体验比Codex还好。其打通PC、App和小程序,实时同步电脑内容。还新增资料库等实用功能,让国内用户有更丝滑的Agent工作方式。
在向量数据库公司工作两年后,我学到的37个检索真相
Leonie在向量数据库公司工作两年后,分享37条信息检索经验,涵盖从BM25到RAG等多方面,涉及向量数据库、嵌入模型和向量搜索细节,勾勒技术演进图景,强调选合适工具找信息。
OpenAI 董事会主席:「按 token 计费」大错特错!市场终将选择「按成果付费」
OpenAI 董事会主席 Bret Taylor 参与访谈,探讨创业者在 AI 浪潮中的机会。他将 AI 市场分为三条赛道,认为基础模型创业难,应用 AI 是生路,长尾 Agent 公司或取代 SaaS,商业模式应转向按成果付费。
当AI接管70%代码审查工作,剩下的30%才是 “地狱模式”
2024年初“Vibe Coding”成热词,其虽能快速验证想法,但在大型企业项目中“不可控性”凸显。亚马逊云科技研发的Kiro,尝试解决“从提示词到生产”的断裂问题。目前代码审查多采用混合模式,AI仅处初级阶段。
GPT-4o连验证码都解不了??SOTA模型成功率仅40%
MetaAgentX团队推出Open CaptchaWorld平台,用于测试Agent解验证码能力。实测SOTA多模态模型成功率低,如GPT - 4o也被难住。该平台特点多样,揭示了当前Agent短板及模型设计新方向。
Claude Opus 4.7发布:更严谨的长任务处理与自我验证能力
Anthropic发布Claude Opus 4.7模型,相比4.6版处理长任务更严谨,能自我验证输出。它在视觉、指令遵循、记忆等能力上提升,企业级应用表现出色,还有新功能与安全特性,不过使用成本更高。
Duolingo 和 Shopify 纷纷宣布 AI 优先,围绕 AI 工作的时代已来
Duolingo和Shopify宣布AI优先政策,将用AI取代部分人类工作。Duolingo推出AI创建的新语言课程,转型为“AI优先”模式;Shopify要求全员高效用AI。此外,Genspark Super Agent ARR增速快,未来或属“小团队+AI”时代。
如何科学地“设计”SFT 数据?一次关于 ODA 的完整平台级验证
大模型后训练阶段,SFT数据构建常依赖‘直觉’或‘试错’。上海人工智能实验室OpenDataLab团队发布报告,基于OpenDataArena提出新范式,将数据集构建从‘随机艺术’变为‘确定性工程’,并进行平台级验证。