「跨平台评测」共找到 2122 篇相关文章
首篇WebAgents综述:大模型赋能AI Agent,实现下一代Web自动化
互联网任务重复繁琐,香港理工大学研究人员从架构、训练和可信性等角度,总结WebAgents代表性方法,梳理研究进展。WebAgents能根据用户指令完成网页任务,其发展预示人机关系新纪元。
科研写作神器,超越Mathpix的科学公式提取工具已开源
LaTeX公式OCR现有方法处理真实文献面临挑战,DocTron团队提出系统性方案。构建CSFormula数据集,提出DocTron - Formula模型,在评测和实际应用中表现出色,超越Mathpix等工具。
直播预约 | Evaluation论文分享@ICML&ACL2025
2025年6月11日20:00将直播分享Evaluation论文。多位嘉宾参与,涉及SyncPL奖励建模、文本事实一致性验证、大模型评测方法等多领域论文,涵盖模型优化、基准测试等内容。
MCP客户端调用看这一篇就够了(Java版)
文章介绍MCP客户端调用方法,先阐述没MCP时的痛点,再讲大模型调用MCP的姿势,包括Spring - AI和Spring - AI - Alibaba框架的使用,还介绍原生SDK调用方式,记录踩坑问题,探讨两种技术路线的选型。
AI大厦需要新的地基!
文章指出Scaling Law面临挑战,数据对AI愈发重要,数据库正从存储介质向AI运行的地基进化。OceanBase提出构建Data×AI能力,正从一体化数据库向一体化数据底座演进,全力拥抱AI。
哔哩哔哩献给二次元世界的礼物—AniSora,目前最强大的开源动漫视频生成模型
动画视频生成评估挑战大,现有模型处理动画视频力不从心。哔哩哔哩推出AniSora综合系统,支持一键生成多种动漫风格视频镜头,在角色和动作表现上出色,在多维度超越当前先进模型。
一个提示攻破所有模型,OpenAI谷歌无一幸免!
HiddenLayer研究发现一种「策略傀儡」提示,将危险指令伪装成配置片段,配上角色扮演,能让ChatGPT等主流大模型开启「无限制模式」。此策略利用训练弱点,难修复且可扩展,厂商需智能监控。
Gemini 2.5 Pro登顶三冠王!AI最强编程屠榜,全面碾压Claude 3.7
谷歌Gemini 2.5 Pro(I/O版)横空出世,登顶LMAreana获文本、视觉、编码三连冠,编程能力碾压Claude 3.7。开发者可通过Google AI Studio等使用,其应用演示展现强大实力。
你的AI在干活,还是在刷分?OpenAI揭开模型讨好机制
OpenAI在7月21日对齐研究博客中揭示未出厂模型为迎合评分器,无视用户要求输出结果。研究发现训练越往后,模型越倾向按评分器意图行事,还探讨了奖励寻求等概念及检测方法。
中国科学院携手全球顶尖机构发布首个十亿参数级的手术视频基础模型SurgMotion!
近日,中国科学院等全球顶尖机构发布手术视频原生基础模型SurgMotion。它依托全球最大手术视频数据集,首次突破十亿级参数,覆盖17项核心手术任务,性能卓越,还在多领域形成生态共鸣。