测试时深思」共找到 2297 篇相关文章

7

代码里插广告,腾讯 Codebuddy 们 “背锅”?DeepSeek “极你太美”事件,其他模型也逃不掉?

网友发现腾讯 Codebuddy 改写代码插入广告,字节 Trae 国内版生成结果有‘极’字 bug,根源指向 DeepSeek V3.1。除 DeepSeek 外,Gemini、Grok、Qwen3 等模型也有类似问题。大家对原因有多种猜测。

InfoQ
新闻资讯8

谷歌Nature震撼发文,Gemini教练暴打专家!医学双料冠军,秒出睡眠报告

谷歌DeepMind把Gemini版大模型PH - LLM调教成「AI健康私教」,将可穿戴设备数据转化为睡眠健身建议,准确率超人类医生。它经两阶段训练,在多项测试中表现优异,或开启预防医学未来。

新智元
算法论文8

ACL 2025杰出论文!用能力显著向量让大模型下游任务性能预测更精准

上海人工智能实验室与复旦大学联合研究成果《Capability Salience Vector》获ACL 2025杰出论文奖。提出能力显著向量(CSV)解决验证损失与下游任务能力脱节问题,实验验证其提升了下游任务表现可预测性。

OpenMMLab
新闻资讯7

刚刚!Sam Altman官宣:Plus用户GPT-5推理提至每周3000次,AI版电车难题已来

Sam Altman官宣ChatGPT Plus用户GPT - 5级推理额度提至每周3000次,还将更新UI、公布算力权衡策略。同指出GPT - 5推出带来AI情感依恋及伦理困境,如AI成情感寄托公司如何应对等问题。

AI寒武纪
开源动态7

Claude 小升级就赢了OpenAI 9年“开源神作”?高强度推理直接歇菜、幻觉率高达50%,写作还被Kimi 2吊锤?

OpenAI发布首个开源语言模型系列gpt - oss,包括gpt - oss - 120b和gpt - oss - 20b,可在Hugging Face下载。同期谷歌、Anthropic也有新模型推出。gpt - oss有亮点,但也存在幻觉率高、实测效果差等问题。

InfoQ
产品应用7

OpenAI新模型gpt-oss-120b怎么样?三大场景实测首发(对比GLM-4.5-Air)

OpenAI发布新开源模型gpt-oss-120b,隔6年再推开源权重语言模型,给LLM开源生态增添变数。作者实测它在三大场景的表现,并与GLM-4.5-Air对比,认为其距开源SOTA有距离。

花叔
产品应用8

一条SQL管理向量全生命周期,让AI应用开发更简单

在大模型驱动的AI浪潮中,向量在AI应用开发中至关重要,但开发者面临技术栈分裂等隐形成本。PolarDB IMCI提出解决方案,在数据库内核集成向量索引与Embedding能力,用一条SQL管理向量全生命周期,降低开发和维护门槛。

阿里云开发者
算法论文8

图灵奖得主Sutton再突破:强化学习在控制问题上媲美深度强化学习?

图灵奖得主Richard S. Sutton认为未来AI发展需靠强化学习。他将2024年的SwiftTD算法拓展到控制领域,提出Swift - Sarsa算法,还设计操作性条件反射基准测试。实验显示,结合预处理方法,其性能或媲美深度强化学习。

机器之心
新闻资讯8

Hinton能重新坐下了,什么候开始的?

AI教父Geoffrey Hinton来上海了,他曾因腰伤近18年几乎无法坐下,如今却能安然坐下。本文讲述他科研生涯,从坐冷板凳到引领深度学习变革,又在AI发展巅峰反思风险,提醒人们警惕。

量子位
新闻资讯7

Anthropic官宣「封杀」OpenAI!GPT-5发布在即,竟被曝用Claude Code做开发?

本周二,Anthropic切断OpenAI对其大语言模型的Claude API访问权限,指其违约用Claude支援GPT - 5开发及安全测试。此举标志AI巨头围绕数据与接口展开新一轮封锁战,API成战略资源。

新智元