「模型实测」共找到 7932 篇相关文章
不玩Harness,卷Model,Meta说:模型即计算机
当下AI圈热捧Harness Engineering,Anthropic让Harness从概念成产品,众多企业纷纷入局。但Meta反其道而行,发布Muse Spark模型,还联合提出神经计算机领域,其论文对相关概念做了介绍并展示实验结果。
2025,大模型文档解析(OCR)年终盘点
2025年6月以来文档解析方法快速增长,有10余种。按“技术路线 + 工程形态”可归为4大类:传统级联流水线、轻量多模态两段式、通用多模态大模型一段式、轻量多模态一段式,各有优劣,4条路线覆盖所有OCR落地场景。
全网实测Gemini Omni!一句话改视频,草图变大片
谷歌在Google I/O大会推出Gemini Omni,它结合推理与生成能力,在多方面有重大飞跃,能生成逼真视频等。它打破命名体系,训练目标不同,有涌现能力,谷歌还为其设置限制。
SimpleTIR:让大模型“边写代码边思考”不再崩溃
SimpleTIR可解决多轮工具调用中训练崩溃问题。作者指出崩溃原因是分布偏移、低概率token链式雪崩和梯度爆炸。它采用void turn过滤,掐断崩溃链路,训练稳定,还催生多样推理行为,且工程友好已开源。
一手实测 Amazon Quick:我看到了企业级 Agent 的未来!
本文针对企业AI工具碎片化、员工沦为Agent间搬运工的痛点,对刚GA发布的亚马逊云科技Amazon Quick做一手实测,分析其核心能力与壁垒,判断企业级Agent发展趋势。
Claude Fable 5.1与GPT-5.6社区一手实测
Anthropic的Claude Fable 5.1刚上线,社区就将其与OpenAI的GPT - 5.6 Sol实战对决。采用同一提示词等严苛规则,结果Fable 5.1细节碾压但有bug,成本高;GPT - 5.6 Sol成本低、风格稳定。还给出选型参考。
FriendliAI获2000万美元,以加速AI模型推理工作负载
专注AI推理的初创平台FriendliAI获2000万美元种子扩展轮融资,资金用于加速平台开发。其专有推理优化技术可降低模型运行成本和能耗,能为用户省90%的GPU成本,合作客户广泛。
不再止步于自然语言!PhiZero让世界模型学会「物理语言」
PhiZero由中科院自动化所团队研发,探索让AI读懂真实世界运动、交互与变化的“物理语言”。它构建Reason - then - Render框架,经大量数据训练,在多基准测试中表现领先,为AI理解物理世界开辟新通道。
大模型Agent的下一阶段:可自我进化的AI-Agent
在人工智能飞速发展下,研究者探索让AI自我反思改进。本文作者构建自我进化AI智能体系统,设计四层渐进式架构,经《卡坦岛》实验,证明自我进化能力,不同模型表现有差异,代码级进化潜力惊人。
最强开源搜索再升级,研究、预测能力实测超惊艳!
MiroMind团队发布新一代模型MiroThinker-1.7和MiroThinker-H1,定位为重型推理智能体。其研究能力强、推理可靠,还能生成网页报告。新版本升级显著,靠两项关键技术实现有效交互,且预测案例表现出色。