「大模型自信问题」共找到 9547 篇相关文章

新闻资讯7

4B Qwen3逆袭671B DeepSeek!字节DAPO微调方法这么猛的吗

最新模型Jan - nano引发关注,它在智能体任务上超671B的DeepSeek - V3 0528,在SimpleQA基准获80.7分。它基于Qwen3 - 4B用字节&清华DAPO微调方法。其研发团队是Menlo Research,有开源产品和长远规划。

量子位
新闻资讯8

英伟达新“桌面超算”800GB大内存,满血DeepSeek R1能装1个半

英伟达在Computex大会宣布新办公室落户中国台湾省台北市,还推出多款新品。如面向个人的DGX Station有800GB内存,能跑大模型;面向企业的RTX PRO Server可加速多种用例。此外,还发布新平台、宣布合作等。

量子位
开源动态8

阿里重磅开源!Open Code Review:一周 5k star,为你的代码保驾护航

阿里开源 Open Code Review,它前身是内部 AI 代码评审助手,经大规模验证。该工具结合确定性工程与 Agent,解决通用 Agent 评审代码的问题,在准确率、效率等方面表现出色,还介绍了使用方法和评估方式。

阿里云开发者
算法论文8

32B逆袭GPT-5.2:首个端到端GPU编程智能体框架StitchCUDA问世

现有LLM自动化CUDA方法难处理端到端GPU程序,StitchCUDA提出多智能体框架+基于Rubric Reward的Agentic RL方案,分解任务、优化训练,在实验中成功率和加速比远超其他方法,解决Reward Hacking问题。

机器之心
新闻资讯8

推进科研和工程,编程跻身顶级人类竞赛榜:谷歌Gemini 3 Deep Think重大升级

谷歌发布Gemini 3 Deep Think重大更新,剑指科研和工程。它在编程算法竞赛等多项测试中成绩亮眼,能模拟人类科学家深度思考,处理复杂问题,还可重塑工程设计流程,已向部分用户和企业开放。

AIGC开放社区
新闻资讯8

Sam Altman与开发者的一小时对话:我们在“梦游般”走向风险,人类经不住Agent诱惑

Sam Altman在与开发者生态交流会上,针对GPT-5写作能力下降问题坦率回应,还发出一系列重磅信号,如警告生物安全风险、披露招聘计划等,并就软件工程、AI Agent等多个话题分享看法。

AI寒武纪
推荐文章7

规范驱动开发:让架构变得可执行

文章介绍规范驱动开发(SDD),它是软件架构重大转变,以可执行规范为核心,构建五层执行模型,反转传统架构关系,强调漂移检测,明确人机分工,具备五项核心能力,但采用时也面临多种权衡。

InfoQ
产品应用8

不上云、不租卡,如何优雅地在本地微调Qwen-VL-30B?

文章指出企业训练多模态助手,30B 参数的开源多模态模型如 Qwen-VL-30B 是不错选择,但多模态场景下显存需求大。联想 ThinkStation PGX 解决了显存难题,还介绍其性能、优势、适用场景及服务等。

机器之心
新闻资讯7

5个月内失败十几次,几人团队在压力下做出爆款App!网友:AI时代懂人性比懂技术更重要

社交应用 Candle 上线六个月用户超 30 万,月营收超 15 万美元。其创始人曾开发 Encore 未成功,后经多次试错,受人际关系问题启发打造该应用,旨在维护亲密关系,不过也面临用户留存和功能体验挑战。

AI前线
新闻资讯7

Anthropic 联创曝内部工程师已不写代码了,但工作量翻倍!开发者嘲讽:所以 Claude bug才那么多?

Anthropic联合创始人透露公司工程师已不写代码,通过管理AI Agent系统写代码,工作量达原来2 - 3倍,还提议向AI公司征税。但开发者质疑Claude存在诸多问题,认为AI写代码未到革命地步。

AI前线