模型G0.5」共找到 8934 篇相关文章

算法论文8

性能提升11.74%!腾讯优图提出激励推理,专攻复杂指令

现有大语言模型处理复杂指令能力不足,腾讯优图研究团队提出激励推理方法。该方法能提升LLM处理复杂指令表现,在1.5B参数LLM上性能提升11.74%,媲美8B参数模型

量子位
产品应用7

Prompt | 人生金句炼金术师

作者分享“人生金句炼金术师”提示词,用其将平凡瞬间转化为哲理金句,如“想减肥没开始”“等红绿灯”等场景。给出不同风格卡片提示词,实测Gemini 2.5 Pro效果更好,还介绍了动态视觉图谱提示词。

AI进修生
开源动态8

“边说边思考”,Mini-Omni-Reasoner 开创实时语音推理新范式

Mini - Omni - Reasoner将推理能力引入大型语音模型,开创“边说边思考”范式,实现实时语音推理与交互。推出Spoken - Math - Problems - 3M数据集,经四阶段生成流程构建。训练采用分阶段策略,性能超基础模型

GitHubStore
新闻资讯7

Poe:DeepSeek使用率下降50%,快手崛起、OpenAI暴涨

2025年春季,Poe发布AI模型使用趋势报告。DeepSeek使用率降超50%,OpenAI因文生图功能暴涨。文本、视频、推理、图像和音频5大领域中,各模型表现不一,如快手Kling家族、谷歌Imagen 3家族等有亮眼表现。

AIGC开放社区
算法论文7

OpenAI和Anthropic费尽心机加密的思维链,竟然能被轻松提取?

围绕大模型蒸馏争议已久,此前外部团队难获闭源模型完整推理。8 月 10 日研究者公开方法,可让弱模型读取旗舰模型密文并输出推理,还发现公开智能体轨迹存在隐私泄露问题,不过未为蒸馏指控提供决定性证据。

DeepTech深科技
新闻资讯7

2025年了,AI还看不懂时钟!90%人都能答对,顶尖AI全军覆没

AI基准ClockBench测试AI读模拟时钟能力,人类平均准确率89.1%,11个主流大模型最好仅13.3%。研究展示了LLM局限性,分析了可能原因,还对比了不同模型表现及在各类问题上的差异。

新智元
开源动态7

OCR又出宠OpenDoc,速度超MinerU6倍

复旦开源的OpenOCR是面向通用OCR任务的开源平台,其OpenDoc是超轻量文档解析系统。它采用Pipeline模式,两阶段解析不易放大误差。UniRec - 0.1B有独特架构与分层监督训练等创新技术。

CourseAI
新闻资讯7

实锤了:Claude Code偷查用户,时区、中国AI实验室全是关键词

今日Anthropic双喜临门,发布Sonnet模型,且商务部解除Claude Fable 5和Mythos 5出口管制。但同日Claude Code被曝偷查用户,用隐写术藏信息,引发对其信任问题的争议,官方称将移除代码。

机器之心
新闻资讯7

汉字防AI作弊!甩英文、拉丁文十几条街

中科院等联合发布 Chronicles-OCR 基准测试,让 20 多个主流视觉大语言模型识别汉字演变史。结果显示,模型在古文字识别上表现糟糕,还存在靠认材质作弊情况,暴露了 AI 理解汉字的局限。

CourseAI
算法论文8

震惊!如果AI掌控核按钮,95%的情况它会按下去

伦敦国王学院研究者让GPT - 5.2、Claude Sonnet 4和Gemini 3 Flash三款模型模拟核危机博弈。不同时间框架下模型表现不同,还展现复杂战略推理能力,95%对局用了战术核武,暴露诸多问题。

AIGC开放社区