可信度评测」共找到 647 篇相关文章

算法论文8

68页论文再锤大模型竞技场!Llama4发布前私下测试27个版本,只取最佳成绩

《排行榜幻觉》论文指出Chatbot Arena存在问题,如少数大厂私下多版本测试选最优、数据访问不平等、用Arena数据训练可提性能、模型被大量静默弃用等,研究团队给出改进建议,官方也进行了回应。

量子位
产品应用8

字节豆包2.0重磅发布!成本暴降一个数量级,Seed团队揭秘视频Agent竞争关键

今日字节发布豆包大模型2.0系列,围绕大规模生产环境需求优化,有Pro、Lite、Mini和Code四款模型。其Token单价低一个数量级,多模态理解能力升级,未来将围绕长链路智能系统构建发展。

InfoQ
开源动态8

腾讯开源了一个通用智能体,又刷榜了GAIA~

腾讯优图实验室开源了 `Youtu-agent`,在深度搜索和工具使用benchmark上表现佳。它不依赖GPT/Claude,有自动智能体生成功能,提供单、多智能体模式,还集成分析平台,可实时调试与离线分析。

探索AGI
推荐文章7

个体如何实现主权AI

文章指出越依赖AI,越要考虑‘主权AI’问题。对个体而言,实现主权AI核心是掌握自身数据等,能随时换底层模型,还介绍积累的四类资产、微调顺序及现实路径。

newtype AI
算法论文8

拒绝「降智、减配、乱收费」:面向LLM API的可信验证框架

大语言模型成AI应用基础设施,黑盒服务模式引发信任危机。研究者提出IMMACULATE审计框架,能在不暴露模型信息、仅1%额外开销下,验证黑盒LLM API执行完整性,检测违规行为,相关论文与代码已公开。

机器之心
开源动态8

如何科学地“设计”SFT 数据?一次关于 ODA 的完整平台级验证

大模型后训练阶段,SFT数据构建常依赖‘直觉’或‘试错’。上海人工智能实验室OpenDataLab团队发布报告,基于OpenDataArena提出新范式,将数据集构建从‘随机艺术’变为‘确定性工程’,并进行平台级验证。

深度学习自然语言处理
开源动态7

被DeepSeek带火的OCR,最新8个开源模型盘点~

DeepSeek-OCR发布让OCR大热,PaperAgent梳理盘点8个热门开源OCR模型,如DeepSeek-OCR用‘上下文光学压缩’技术,Nanonets-OCR2-3B以零样本视觉链式思维为核心等。

PaperAgent
算法论文8

首篇WebAgents综述:大模型赋能AI Agent,实现下一代Web自动化

互联网任务重复繁琐,香港理工大学研究人员从架构、训练和可信性等角度,总结WebAgents代表性方法,梳理研究进展。WebAgents能根据用户指令完成网页任务,其发展预示人机关系新纪元。

新智元
开源动态8

科研写作神器,超越Mathpix的科学公式提取工具已开源

LaTeX公式OCR现有方法处理真实文献面临挑战,DocTron团队提出系统性方案。构建CSFormula数据集,提出DocTron - Formula模型,在评测和实际应用中表现出色,超越Mathpix等工具。

机器之心
算法论文8

DeepResearch的概念、核心挑战与进化路径

华为、利物浦大学等研究者撰写综述文章《DEEP RESEARCH AGENTS》,梳理了DeepResearch进展。它由大语言模型驱动,超越RAG等现有技术,介绍其核心技术组件,指出面临的挑战并指明未来发展方向。

AI工程化