生成式 AI
腾讯摘要 / SOURCE SUMMARY
- 1.腾讯摘要称,Grok 4.7 换用更大基础模型并延长强化学习周期,重点提升长时任务、自我检查和长上下文管理。
- 2.厂商公布 CursorBench 4.0 得分 46.3%、Terminal-Bench 4.0 得分 38.0%,并称多项专业评测较上代提升。
- 3.标准版每百万输入、输出 Token 分别为 2 美元和 6 美元,已上线 Cursor 与 Grok Build;摘要同时记录了外界对跑分的质疑。
扩展解读 / READ
关联原文正文已读取。架构、速度与评测成绩主要来自厂商发布,不能直接外推到不同 Harness 和真实代码库;摘要保留了外界异议,说明榜单仍需结合独立测试阅读。
为什么重要 / WHY IT MATTERS
编码智能体正从短任务生成转向可持续数小时的工作流。团队选型应同时观察任务成功率、错误恢复、上下文稳定性、延迟与总成本。
腾讯摘要 / SOURCE SUMMARY
- 1.腾讯摘要称,小米发布并开源 MiMo-V2.6 Pro 与 Flash 两款原生全模态模型,Pro 版在 Artificial Analysis 综合智能指数获 46 分,API 沿用 V2.5 定价。
- 2.不到六天的 Live RL 训练中,Flash 与 Pro 成本约 85 万和 262 万美元,累计约 75 万条轨迹,DeepSWE v1.1 分别提升约 17 分和 14 分。
- 3.模型展示 3D 游戏、Blender、机械臂与 Lean 任务能力,并同步开源 7000 多个强化学习任务环境和端到端训练框架。
扩展解读 / READ
关联原文正文已读取。开源模型、环境和框架提高了可复现性,但榜单排名、训练成本和任务增益仍依赖厂商给定的设置,不能自动证明跨任务泛化或持续自我改进。
为什么重要 / WHY IT MATTERS
把强化学习环境与训练基础设施一并开放,比只发布权重更利于外部复现和二次训练,也让环境质量、奖励设计和算力效率成为竞争重点。
腾讯混元推出 Hy Image3.5 preview,2K 图片定价 0.15 元
腾讯混元发布 Hy Image3.5 preview,专业级生图低至 0.15 元
腾讯摘要 / SOURCE SUMMARY
- 1.腾讯混元发布 Hy Image3.5 preview,支持文生图、图生图、多轮编辑和最多五张参考图,最高输出 2K。
- 2.腾讯云 API 对 2K 输出图按 0.15 元/张计费;内部设计师盲测称其与 Seedream 5.0 Pro 持平,并略优于 Nano-Banana Pro。
- 3.模型已接入元宝、ima 与 WorkBuddy 等应用;腾讯摘要称灰度期元宝生图请求量提升超过 50%。
扩展解读 / READ
关联原文正文已读取,内容属于腾讯产品发布口径。价格和接入范围可据发布信息确认,但约 30% 的能力提升、内部盲测与请求增长缺少公开样本和第三方复现。
为什么重要 / WHY IT MATTERS
低价 2K 输出、多参考图与连续编辑有利于图片生成进入批量生产流程;团队仍需用自身素材测试文字、主体一致性、审核和版权边界。
腾讯摘要 / SOURCE SUMMARY
- 1.理想 Foundation Model 团队发布 ME-Dex-1.0,将触觉和视频共同视为未来世界状态,并联合建模视频、触觉与动作序列。
- 2.模型把异构触觉映射到双手 34 个区域,采用视觉、触觉、动作三专家架构与共享注意力,并用数据引擎扩充仿真样本。
- 3.腾讯摘要称其在 RoboTwin、DexJoCo 与 ManiFeel 等任务上领先基线,其中电源插头插入成功率从 58% 升至 88%。
扩展解读 / READ
关联原文正文已读取。技术路线表明触觉可作为动作学习的反馈信号,但各项成功率来自论文设定;是否能跨传感器、机器人本体和真实环境稳定迁移仍需复现。
为什么重要 / WHY IT MATTERS
只依赖视觉难以判断接触、滑动和受力。统一异构触觉表示可能改善精细操作,但也增加传感器标定、数据质量和安全验证成本。
腾讯摘要 / SOURCE SUMMARY
- 1.腾讯摘要称,真武 V900 单芯片算力为 M890 的三倍,配备 216GB 显存和 1200GB/s 片间互联,单集群可扩展至 50 万卡。
- 2.平头哥规划一年一代,2028 年第三季度推出 J900;磐久超节点服务器面向千卡全带宽 Scale-Up 互联与百 TB 级统一显存。
- 3.倚天 720 与 730 CPU 预计 2027 年第三季度推出;厂商称真武已服务 650 多家客户,T-Head SAIL SDK 核心组件完成开源。
扩展解读 / READ
关联原文正文已读取,参数、客户数和路线图均属于厂商发布。V900 尚未按计划进入量产使用,集群上限也不等于实际部署规模或有效训练吞吐。
为什么重要 / WHY IT MATTERS
大模型算力竞争越来越依赖芯片、互联、内存与软件栈的系统协同。对采购方而言,量产时间、生态适配、集群利用率和供货稳定性比峰值参数同样关键。
腾讯摘要 / SOURCE SUMMARY
- 1.腾讯摘要称,海光 1000 系列面向低功耗、嵌入式和端侧场景,采用 4 核 8 线程 C86 架构,支持 DDR4/DDR5 与 4K60 双路显示。
- 2.摘要称典型 TDP 低至 10W,支持宽温、无风扇设计、ECC 与硬件密码加速,并兼容 DirectX、OpenGL 等生态。
- 3.海光提供七年以上生命周期保障及 IDE、SDK、BSP、RTOS 等开发体系,目标场景包括工业 HMI、机器视觉和边缘网关。
扩展解读 / READ
本次仅取得关联文章标题,具体规格、兼容性和生命周期承诺均按腾讯摘要呈现,不补充未读取正文中的细节。
为什么重要 / WHY IT MATTERS
端侧工业设备看重低功耗、既有软件兼容和长期供货。新品能否规模落地仍取决于整机适配、实时性、可靠性和开发工具成熟度。
前沿科技
腾讯摘要 / SOURCE SUMMARY
- 1.OpenAI 宣布与普林斯顿高等研究院托管的数学与人工智能顾问组合作,就模型产出数学成果的评估、审查和发布方式获取建议。
- 2.OpenAI 称一款 8 月底开始训练的内部模型除纳维—斯托克斯问题外,已解决 100 多道长期开放问题,但结果尚未全部公开或接受独立审查。
- 3.首批九位顾问包括 Gowers、Hairer 与 Witten;成员不接受 AI 公司报酬、建议可公开,但没有发布否决权。
扩展解读 / READ
本次仅取得关联文章标题。腾讯摘要明确把百余项结果归于 OpenAI 自述,并指出尚未完成公开和独立审查,因此不能写成数学共同体已确认的突破。
为什么重要 / WHY IT MATTERS
模型生成数学结果的速度若超过同行评议能力,审查、归属、可复现工程和发布节奏会成为新的治理瓶颈;顾问独立性还取决于权限与透明度。
报告观点
腾讯摘要 / SOURCE SUMMARY
- 1.TypeSafe 创始人 Diogo Almeida 认为,行业过度强调拟人聊天,而软件需要的是带概率和置信度的结构化决策。
- 2.他主张把大型提示拆成许多可度量、可调试的微小判定,用置信度阈值和模型级联替代盲目微调,并批评现有 Function Calling 设计。
- 3.他提出五年内推动全要素生产率增长 3% 的团队目标,并认为部分实验室呼吁放慢研发含有监管与政治考量。
扩展解读 / READ
本次仅取得关联文章标题。决策模型、提示拆分和模型级联属于创始人的产品与技术主张;生产率目标和对其他实验室动机的判断都不是已验证事实。
为什么重要 / WHY IT MATTERS
Agent 中大量步骤是分类、路由和评分,不一定需要长文本生成。若结构化决策可校准,系统会更易测试;但阈值、错误代价和兜底机制必须显式设计。
腾讯摘要 / SOURCE SUMMARY
- 1.姚顺宇认为,自生成数据训练只是 RSI 的早期形态;更完整的 RSI 涵盖训练流程、调度、上下文和硬件优化等系统层面。
- 2.他指出自我迭代并非最难,验证迭代确实有效才是瓶颈;模型执行力强,但难以自行定义可靠的评估标准。
- 3.与会者认为公开基准容易被针对性优化,创业公司更适合把通用模型能力转化为行业知识、数据与环境能力。
扩展解读 / READ
本站通过 36氪独立发布页面读取了完整正文。文章记录多位嘉宾观点,并未证明开放式 RSI 已实现;正文还强调短期验证仍需要专家参与、环境可复现性和高质量评测。
为什么重要 / WHY IT MATTERS
自我改进系统若不能区分真实进步与指标投机,就可能把错误放大。可靠环境、保留集、人工审查与可回滚实验应先于“完全自治”的叙事。