「AI模型测试」共找到 13965 篇相关文章
Token烧不起了?比肩Claude Opus 4.6免费模型来了,还将开源
昆仑万维旗下天工AI发布SkyClaw - v1.0,为Agent场景深度优化,免费试用后将开源,价格低。性能超同级别开源对手,逼近闭源巨头。训练围绕环境构建、数据合成、强化学习展开,适合长链路Agent工作流。
DeepSeek-OCR是「长文本理解」未来方向?中科院新基准VTCBench给出答案
DeepSeek - OCR的VTC技术可实现高压缩率,降低长文本处理成本。但视觉语言模型能否理解压缩信息存疑,中科院等推出VTCBench评估,测试模型认知极限,还推出VTCBench - Wild检测鲁棒性。
超越ZIP的无损压缩来了!华盛顿大学让大模型成为无损文本压缩器
华盛顿大学SyFI实验室提出LLMc,利用大型语言模型进行无损文本压缩。基准测试显示其压缩率优于传统工具,且项目已开源。不过,当前版本存在效率、吞吐量等问题,应用范围也主要在自然语言。
阿里重磅开源:端到端VLM文档解析模型,图片直出结构化HTML!
在AI文字识别类应用中,文档解析常不尽人意。阿里开源端到端文档解析模型Logics - Parsing,基于VLM,能图片直出结构化HTML,有统一、智能、精细等亮点,还给出使用步骤。
字节开源多模态复杂文档解析模型!Dolphin:页面与元素并行解析,精准解析复杂文档!
多模态AI与文档解析兴起,传统OCR解析复杂文档常出错。字节跳动开源多模态模型Dolphin,通过两阶段机制精准解析,有多种功能,安装使用友好,适用于多场景,降低了复杂文档解析门槛。
马斯克翻车了!一边告OpenAI,一边偷偷蒸馏ChatGPT
4月30日,加州奥克兰联邦法院,马斯克诉OpenAI案进入第四天。马斯克承认自家Grok模型部分蒸馏了ChatGPT,还为AI公司排名,xAI垫底。法官拦下讨论AI灭绝话题,下周OpenAI联合创始人将出庭。
AI搜索平台Glean获1.5亿美元,估值72亿美元
CNBC消息,AI搜索平台Glean完成1.5亿美元F轮融资,估值升至72亿美元。其核心产品是企业级搜索平台,可集成多应用。资金将用于团队扩张和拓展市场,但也面临激烈竞争,技术可与大模型互补。
李飞飞的创业公司放大招:只要一个 H100 就能跑世界模型
“AI 教母”李飞飞的创业公司 World Labs 推出高效世界模型 RTFM,只需一个 H100 GPU 就能一边和用户交互,一边实时渲染 3D 世界,显著降低硬件成本和部署难度,渲染效果也不俗。
这个春节P图不求人!小红书开源图像编辑新SOTA
今日小红书基础模型FireRed - Image - Edit亮相,在复杂编辑指令、风格化转换等核心指标表现强,在多项权威测试达SOTA。该项目代码等已开源,模型权重将开源。团队还推出RedEdit Bench评测方案。
B站爆了!Hermes首度直播回应「抄袭」,MiniMax提前杀入Harness赛点
Hermes Agent业务负责人回应抄袭质疑,技术对谈探讨AI竞争新维度。MiniMax动作密集,构建“Model + Harness”双向飞轮,其模型获海外开源圈认可,产品驱动模型优化,还与云厂商合作解决沙箱问题。