「结果计价」共找到 527 篇相关文章
蚂蚁武威:下一代「推理」模型范式大猜想
文章围绕下一代「推理」模型范式展开,蚂蚁技术研究院武威提出不同观点,认为长思维链推理未必最优,未来推理模型或更低维稳定,还探讨推理定义、重要性及解法猜想,如结合快慢思考等。
干货 | 算法岗校招经验分享+吐槽
作者分享算法岗校招经验与吐槽,涵盖个人背景、校招结果、面经。分析算法岗就业、算法与开发差异等情况,给出刷题、实习等方面建议,鼓励校招失利者别灰心。
九月新词新站比赛结果出炉,第一名网站上线当月拿下217K的PV。
社群里的明星朋友Clara通过参加新词新站比赛,副业收入已超工资,即将全职独立开发。9月比赛结果显示,参赛网站类型丰富,第一名网站上线首月就获得217K的PV。
The Batch: 978 | DeepSeek-V4-Pro 更新了
DeepSeek发布旗舰模型DeepSeek-V4-Pro-0813正式版,性能提升,还发布开源agent harness开发者预览版并提价。模型在多指标表现佳,编码能力改进明显,公司公开基准测试框架意义大。
四大AI手搓蒙娜丽莎!8次临摹,最像那版全被自己改没了
AI工具平台TryAI搭建「绘画竞技场」,让GPT - 5.6 Sol等四个视觉模型临摹蒙娜丽莎等,记录实验过程。结果显示,模型最终作品不如中途最佳版,且成本差异大,工具使用方式不同。
GPT-5.2已上线24小时:差评如潮!
OpenAI 十周年推出号称强大的 GPT - 5.2,却差评如潮。它在 SimpleBench 测试结果不佳,回答不稳定,编程和艺术创作效果差,情商低、不通人性,审查和安全拒绝机制也饱受诟病。
「我受够了Transformer」:其作者Llion Jones称AI领域已僵化,正错失下一个突破
颠覆性论文《Attention is all you need》作者之一Llion Jones在TED AI大会称厌倦Transformer。他认为AI领域资源多但创造力降,过度聚焦单一架构或错失重大突破,建议调高‘探索旋钮’并分享结果。
Manus:3大核心策略,破解AI Agent上下文膨胀难题
当AI Agent调用工具结果大量涌入上下文窗口,LLM性能会下滑。Manus联合创始人拆解其上下文工程逻辑,给出‘减少、卸载、隔离’三大策略及模型选择等方法,还提炼出6条实践启示。
软件正在吞噬劳动力:直接取代人类,捕获前所未有的经济价值
a16z 普通合伙人 Alex Rampell 演讲指出,软件正从辅助人类转向直接取代劳动。过去软件是将文件柜数字化,如今正从记录工具变为任务执行者,这将催生新商业模式,捕获巨大经济价值。
多模态RAG哪家强?9 个 Embedding、4 类 MLLMs、4 大框架实景比拼
现有文档 RAG 评测存在不足,华南理工和华科推出 DOUBLE - BENCH 进行多模态 RAG 实战评测,结果显示检索是瓶颈,模型爱胡说。快手开源 Keye - VL - 1.5 - 8B,PaperAgent 有实操指南。