「评测领先」共找到 1022 篇相关文章
AI浪潮之下:存储来到聚光灯下
AI浪潮下,行业对存储设备重视上升。其根因是AI业务刺激,数据量增长且推理业务有新需求。信通院报告显示我国存力结构优化,国内厂商迎来机会,平头哥镇岳510主控芯片表现出色,生态建设也在推进。
从“造工具”到“用仓库”:RepoMaster,驾驭GitHub解决复杂任务的智能体大师!
RepoMaster旨在让AI智能体解决复杂开发任务。它能利用深度搜索定位GitHub仓库,其核心框架分三步闭环解决智能体‘看不懂、用不来’难题。实验显示它性能超主流框架,效率高,设计科学。
首篇WebAgents综述:大模型赋能AI Agent,实现下一代Web自动化
互联网任务重复繁琐,香港理工大学研究人员从架构、训练和可信性等角度,总结WebAgents代表性方法,梳理研究进展。WebAgents能根据用户指令完成网页任务,其发展预示人机关系新纪元。
科研写作神器,超越Mathpix的科学公式提取工具已开源
LaTeX公式OCR现有方法处理真实文献面临挑战,DocTron团队提出系统性方案。构建CSFormula数据集,提出DocTron - Formula模型,在评测和实际应用中表现出色,超越Mathpix等工具。
美团提出首个语音交互GUI智能体,端到端语音训练能力优于传统文本训练
美团和浙大联合推出GUIRoboTron - Speech,这是首个能利用语音指令和屏幕截图端到端决策的自主GUI智能体。它解决了文本依赖问题,团队经多步骤研发,其性能评估表现佳,还给出招聘信息。
有一说一,老周还真的挺懂 Agent 的
360 AI 发布会,老周回应市场部一事,称是让员工养成用 AI 习惯。他懂 Agent,认为其将成 AI 应用标准形态,360 从搜索切入,推出纳米 AI 超级搜索智能体,还发布两款 AI 硬件。
直播预约 | Evaluation论文分享@ICML&ACL2025
2025年6月11日20:00将直播分享Evaluation论文。多位嘉宾参与,涉及SyncPL奖励建模、文本事实一致性验证、大模型评测方法等多领域论文,涵盖模型优化、基准测试等内容。
哔哩哔哩献给二次元世界的礼物—AniSora,目前最强大的开源动漫视频生成模型
动画视频生成评估挑战大,现有模型处理动画视频力不从心。哔哩哔哩推出AniSora综合系统,支持一键生成多种动漫风格视频镜头,在角色和动作表现上出色,在多维度超越当前先进模型。
数据中心不必建在地球!中国企业已经把算力设施送到了太空
国星宇航牵头“星算”计划,首发星座发射成功,将开启全球“太空计算时代”。太空部署算力可节约能源成本、及时处理数据且更安全,未来将与地面“天地协同”,中国在此领域走在前列。
让 Coding Agent 开始「记住过去」:MemoraX Code 的长期记忆系统
过去一年,Coding Agent 改变开发者写代码方式,但进入长期开发仍会遗忘项目经验。MemoraX Code 试图解决此问题,构建了本地与云端记忆,让关键信息能被识别召回,且在赛事中表现出色,还能沉淀工程经验。