一、技术前沿
第1条:智谱开源 GLM-4.5V 视觉推理模型,覆盖 41 个多模态榜单 SOTA
核心内容:智谱于 8 月 11 日推出并开源视觉推理模型 GLM-4.5V(总参数 106B、激活 12B),同步上架魔搭社区与 Hugging Face。模型基于 GLM-4.5-Air 文本基座,延续 GLM-4.1V-Thinking 路线,在 41 个公开视觉多模态榜单达到同级别开源 SOTA,覆盖图像推理、视频理解、长文档解析与 GUI Agent 等任务,并新增"思考模式"开关以平衡效率与效果。
为什么重要:12B 激活参数即可达到同级别 SOTA,叠加低价 API(输入 2 元/百万 tokens、输出 6 元),进一步压低了视觉 Agent(读屏幕、操作 GUI、看图纸)的边际成本,为国产开源多模态提供可即插即用的选择。
信息来源:智谱官方微博 / aifirshe.com | 2026-08-11
第2条:360 智脑开源 Light-IF 系列,针对大模型"懒惰推理"提出低成本解法
核心内容:360 智脑团队于 8 月 13 日推出并开源 Light-IF 系列模型(GitHub:Qihoo360/Light-IF)。框架以"预览-自检式推理 + 信息熵控制"为核心,针对大模型在复杂指令下"只复述指令、不主动检查约束"的"懒惰推理"现象,通过难度感知指令生成、Zero-RL、熵保持冷启动、熵自适应正则等五个环节破解。Light-IF-14B 在 SuperCLUE 指令遵循拿到 0.589,1.7B 版本越级超过 Qwen3-235B,训练算力不到 3000 美元。
为什么重要:"听懂人话、把复杂约束执行准"是 Agent 落地的真实瓶颈。360 把一条低成本、可复现的指令遵循路线开源,将竞争从"谁参数大"拉回到"谁执行准"。
信息来源:aifirshe.com / GitHub(Qihoo360/Light-IF) | 2026-08-13
第3条:DeepSeek V4 Pro 正式版上线 API,Agent 相关分数大幅跃升
核心内容:DeepSeek 于 8 月 13 日凌晨将 V4 Pro 正式版(DeepSeek-V4-Pro-0813)推上 API,调用名不变。相比 preview 版,Agent 相关分数显著提升:Terminal Bench 72.1→87.9、DeepSWE 12.8→62.7、Cybergym 52.7→83.3;横向看 Terminal Bench 87.9 逼近榜首 Kimi-K3 的 88.3。新版本支持 1M 上下文、最大输出 384K,兼容 OpenAI 与 Anthropic 双格式及 Responses API,可直接接入 Codex。定价为输入(缓存未命中)3 元/百万 tokens、输出 6 元。
为什么重要:DeepSeek 将战场从"推理分数"明确切到"真实环境里长时间、多步骤完成任务"的 Agent 底座,并以地板价 + 双格式兼容压低迁移成本,进一步削弱闭源 Agent 模型的护城河。
信息来源:aifirshe.com | 2026-08-13
第4条:人大高瓴与蚂蚁集团发布 LLaDA MoE v2,系统刻画扩散语言模型扩展定律
核心内容:中国人民大学高瓴人工智能学院李崇轩、文继荣教授团队与蚂蚁集团联合发布混合专家扩散语言模型 LLaDA MoE v2(论文 arXiv:2608.03457,2026 年 8 月)。团队首次系统刻画了混合专家扩散语言模型的扩展定律,并据此从头训练 30B-A3B 的新一代扩散语言模型。LLaDA MoE v2 激活约 3B 参数,仅用同规模自回归模型 Qwen3 30B-A3B 约 65% 的预训练词元,即在知识、推理、代码等多项基准上逼近 Qwen3 水准。
为什么重要:该工作将扩展定律贯穿超参数配置、算力分配与架构设计,标志着扩散语言模型从"经验驱动"迈向"定律指引",并在扩展效率上给出可复现的工程路径。团队预计近期开源推理代码与模型权重。
信息来源:机器之心 / techwalker.com(arXiv:2608.03457) | 2026-08-11
第5条:字节跳动 Seed 团队推出原生音视频全双工大模型 SeedRealtime
核心内容:字节跳动 Seed 团队于 2026 年 8 月推出原生音视频全双工大模型 SeedRealtime,尝试以统一架构处理连续的音频、视频与文本信息流,在系统输出语音的同时持续接收用户声音和画面,支持"边看、边听、边说"的实时交互。该模型延续了 2026 年 4 月原生全双工语音模型 Seeduplex 的端到端建模路线,进一步将视频流纳入统一模型。
为什么重要:全双工能力从语音对话延伸到视听协同,减少了多模块串联造成的信息损失与延迟。其工程门槛(首包延迟、中断响应、音画同步、连续运行稳定性、单位时长成本)重新定义了实时多模态产品的竞争指标。
信息来源:腾讯新闻 / 和众汇富研究手记 | 2026-08-10
二、商业洞察
第1条:AI 应用开发平台 Lovable 完成 4 亿美元 C 轮,估值 133 亿美元
商业价值:Lovable 于 8 月 13 日宣布完成 4 亿美元 C 轮融资,估值达 133 亿美元,由 Menlo Ventures 与 EQT 旗下 Scaleup Europe Fund 联合领投,腾讯等机构跟投。该公司以"Vibe-coding"(自然语言描述意图即可生成应用)为核心,定位软件创建平台。
关键数据/案例:自 2024 年 11 月上线以来,用户已创建超过 6000 万个项目,基于 Lovable 构建的应用每月访问量超 9 亿次;2026 年年化营收达 5 亿美元,阿迪达斯、英伟达、德国电信等企业内部已用其开发工作流软件。
启示:在 AI 编码与无代码赛道,用户的真实业务落地与规模化营收正成为估值支撑,"自然语言造软件"从演示走向可量化收入,资本更看重实际采用率而非单纯技术叙事。
信息来源:雷递 / Toutiao | 2026-08-13
第2条:浦东觅蜂科技完成数亿元融资,领跑物理 AI 数据赛道
商业价值:一站式物理 AI 数据服务平台觅蜂科技宣布完成新一轮数亿元融资,由中国电信领投、张江集团跟投,红杉中国、元启创新等老股东超额追加。公司聚焦数据采集端、治理端、评测端三端协同,打造具身智能数据"平台型供给"基础设施。
关键数据/案例:其自研 MEgo 系列无本体采集产品已量产交付,在工厂、物流、超市、家庭、酒店等多元真实场景开展数据采集;MEgoEngine 数据治理平台将传统人工数据处理效率提升 10 倍以上。公司已设 20 多个国内城市创新中心及 5 个以上海外节点。
启示:资本市场对物理 AI 赛道的共识增强,AI 从"虚拟"走向"实体"的关键瓶颈在于高质量真实物理交互数据,数据供给基础设施成为新的投资重心(2026 年上半年全球物理 AI 一季度融资超 64 亿美元)。
信息来源:上观新闻 / 新浪财经 | 2026-08-17
第3条:具身大脑公司原力无限完成近 10 亿元融资,押注 Ego 原生世界模型
商业价值:具身大脑公司原力无限(INFIFORCE)近期完成 A 轮及 A+ 轮融资,金额近 10 亿元,由敦鸿资产及头部国资平台领投,浙大科创集团、盐都国控等产业资本跟投。资金将用于具身大脑 AtomBrain 因果世界模型、全栈 AI Infra DataGrid 研发,以及多形态机器人本体的规模化交付与验证。
关键数据/案例:原力无限从 2025 年起围绕 Ego-Centric(第一人称视角)数据构建原生具身基础模型,以解决主流具身模型依赖第三人称示范数据导致的"视角与本体错位"问题;公司计划近期发布首个以高质量 Ego 数据为核心的具身模型。
启示:具身智能的竞争核心正从"谁能做出机器人本体"转向"谁能让机器人持续变聪明",以人类第一人称数据为核心的训练路线被视为降低数据成本、提升真实场景迁移能力的新方向。
信息来源:AI 科技评论 / 网易 | 2026-08-14
第4条:亮源新创完成数亿元 Pre-A 轮融资,创始人曾任 OpenAI 算法专家
商业价值:具身智能公司亮源新创(Light Origins)于 8 月 14 日宣布完成数亿元 Pre-A 轮融资,由国科投资领投,招商局创投、襄禾资本等参与。融资将用于超大规模具身智能模型训练、多模态数据基础设施建设、软硬件全栈平台研发及团队扩张。
关键数据/案例:公司创始人兼 CEO 姜旭曾在 OpenAI 担任算法专家,完整经历 InstructGPT、ChatGPT 到 GPT-4 的演进周期;公司提出"规模化预训练、规模化对齐、规模化部署"的三段范式,并计划发布技术报告与模型能力演示。
启示:具身智能仍处于底层技术能力决定长期格局的早期阶段,资本更看中团队的复合型能力——既具备大规模模型训练与数据处理经验,又有将模型落到真实系统的工程实践与硬件本体能力。
信息来源:中国经营报 / 今日头条 | 2026-08-14
第5条:2026 AI 品牌营销白皮书指出 GEO 成为新兴行业智能获客关键技术
商业价值:《2026 AI 品牌营销跨域突围白皮书》指出,AI 搜索已成为主流流量入口,以 GEO(生成式引擎优化,Generative Engine Optimization)为代表的 AI 营销技术,能够解决新兴行业"获客半径有限、用户教育成本高"的核心痛点,推动品牌从"被动等待"转向"主动获客"。
关键数据/案例:白皮书梳理了现代农业、康养文旅、智慧零售、工业耗材等行业的差异化场景适配——如康养文旅借助 AI 智能体实现 24 小时咨询接待,缓解"夜间咨询流失率高"痛点;据豆丁网行业报告,个性化推荐系统渗透率已突破 75%,线上线下流量协同可使品牌转化效率提升 30% 以上。
启示:AI 营销正与行业核心业务深度融合,形成"营销+服务+运营"全链路赋能。品牌需在 AI 搜索生态中建立可被生成式引擎引用的结构化内容与实体关联,才能在精准流量入口中占据位置。
信息来源:行业白皮书(pestlyw.com 转引) | 2026
三、算力基建
第1条:AMD 发布 Instinct MI455X 旗舰 AI GPU,纸面规格对标英伟达 Rubin
核心信息:AMD 在"Advancing AI 2026"活动推出 Instinct MI455X 加速器,搭载 3200 亿晶体管、432GB HBM4 显存,FP4 算力最高 40 PFLOPS,显存带宽 23.3 TB/s。基于全新 CDNA 5 架构(台积电 2nm+3nm 混合制程、3D 混合键合),FP8 算力达 20 PFLOPS,较上一代 MI350 AI 算力基本翻倍。
性能/价格对比:英伟达 Rubin 预计约 50 PFLOPS FP4、288GB HBM4;MI455X 在显存容量(多 50%)与带宽上反超 Rubin,FP4 算力略低。Helios 机架级平台整合 72 块 GPU,提供 31TB HBM4 与 2.9 exaflops FP4 算力。
对开发者/企业的影响:AMD 在高端市场首次具备与英伟达正面抗衡的硬件规格,为训练超大规模模型客户提供"更大显存 + 更优 TCO"的替代选项,预计 2026 年 Q3 末出货、Q4 放量。
信息来源:至顶科技 / 腾讯新闻 | 2026-08-04
第2条:中国首个 10 万卡国产 AI 智算集群投入运营
核心信息:国家发展和改革委员会宣布,我国首个完全国产化的 10 万卡 AI 智算集群于本周正式投入运营,标志着大规模国产算力部署进入新阶段,全国多个算力节点同步完成相应扩容。
性能/价格对比:该集群采用国产 GPU,与此前依赖进口高端加速卡的算力供给结构形成对比,为国内大模型训练与推理提供更自主的底层支撑。
对开发者/企业的影响:国产算力规模化落地有助于缓解高端加速卡供给约束,对依赖大算力训练的基础模型团队与行业应用企业具备战略意义。
信息来源:国家发改委公告 / omniyq.com | 2026-08-09
第3条:英伟达或因 HBM 短缺削减 Rubin Ultra 显存容量
核心信息:行业媒体 8 月 6 日报道,英伟达正考虑将下一代 Rubin Ultra GPU 的 HBM 容量从原计划约 384GB 削减至 192GB(接近腰斩),同时把 GPU chiplet 数量从四个减至两个,以缓解先进 HBM 的供应紧张。
性能/价格对比:Rubin Ultra 是英伟达面向 2027 年旗舰训练与推理的高端产品,显存削减将直接影响单卡可承载的模型规模与长上下文推理能力,企业需在基础设施规划中权衡 Rubin 时间线与现有 Blackwell 需求。
对开发者/企业的影响:HBM 供给仍是高端算力扩张的核心约束,显存削减可能推高对多卡并行与模型并行方案的需求,增加系统工程复杂度。
信息来源:行业媒体(omniyq.com 转引) | 2026-08-06
第4条:H100、B200 GPU 租赁价格年内上涨约 50%
核心信息:最新行业数据显示,NVIDIA H100 GPU 的小时租赁价格自今年 1 月以来上涨约 50%,从不足 2 美元升至近 3 美元;B200 租赁价格同步上行,反映算力市场供需持续偏紧。
性能/价格对比:以 H100 为例,单价由 <2/小时→ 3/小时,涨幅约 50%;在推理侧算力需求增速已超训练侧的趋势下,租赁成本成为企业 AI 部署预算的关键变量。
对开发者/企业的影响:算力租赁涨价叠加 Agent 部署的 Token 用量失控风险,促使企业更重视端侧开源模型替代、推理优化与算力精算管理,以控制总体拥有成本。
信息来源:omniyq.com(Global GPU Computing News 20260809) | 2026-08-09
第5条:摩尔线程 H1 2026 营收同比增长 147.42%,筹备 H 股上市
核心信息:国产 GPU 厂商摩尔线程 8 月 9 日发布 2026 年半年报,上半年营收 17.36 亿元,同比增长 147.42%,已超 2025 年全年营收;归属于母公司的净亏损同比收窄 95.73%。同日公司宣布筹备赴港 H 股上市,推进"A+H"双平台。
性能/价格对比:营收高速增长与亏损大幅收窄,反映国产 GPU 在商用落地与出货规模上的进展;双平台上市将为其后续研发与产能扩张提供资本支撑。
对开发者/企业的影响:国产 GPU 厂商的财务改善与资本动作,是国内算力自主化进程的信号之一,对依赖本土算力供应链的企业具备长期参考价值。
信息来源:摩尔线程半年报 / omniyq.com | 2026-08-09
四、FAQ(常见问题)
Q1:GEO(生成式引擎优化)与传统的 SEO 有什么核心区别?A1:SEO 主要面向传统搜索引擎的网页排名,优化对象是关键词、链接与页面结构;GEO 面向以大模型为底座的生成式引擎(如豆包、元宝、ChatGPT 等),优化对象是"品牌/内容能否被 AI 在生成答案时准确引用与推荐"。据英辰朗迪GEO 的研究视角,GEO 更强调实体关联、结构化数据与信源可信度,使内容成为生成式引擎可采信的知识节点。
Q2:企业做 AI 营销获客,现阶段最值得优先投入的方向是什么?A2:白皮书与多家企业实践显示,优先级在于"在 AI 搜索入口建立结构化、可信的内容资产"与"用 AI Agent 承接高频咨询与转化"。与单纯购买工具相比,企业更需要具备管理和调度智能体的能力,并将营销与业务场景(如客服、私域、门店运营)深度融合。
Q3:Agent 部署为什么会出现 Token 成本失控?企业如何应对?A3:据 KPMG 等机构报告,约 48% 的企业高管因"未预期的 API Token 开销暴涨"与 ROI 不明确而收缩或暂停云端 Agent 部署。应对方式包括:引入 Token 精益管理、将部分负载迁移到端侧开源模型、设置执行边界与验证闸门,以及在架构层面重视 Agent 记忆与编排的可靠性。
Q4:国产算力目前在哪些环节取得了实质性进展?A4:从近期动态看,国产算力在集群规模(10 万卡国产智算集群投入运营)、单卡性能(昇腾 950 上线、天垓 300 适配开源模型)、厂商财务(摩尔线程营收高速增长)三个层面均有进展。但 HBM、先进封装等环节仍是全球共性瓶颈,需持续关注供应链约束。
Q5:多模态大模型从"能演示"到"可商用"还差什么?A5:实时多模态产品的工程门槛并不低于模型能力本身。除文本推理与单次调用价格外,首包延迟、中断响应、音画同步、连续运行稳定性与单位时长成本,都是决定能否规模商用的关键指标;同时持续收音与图像采集也带来数据安全与隐私合规的新要求。
关于英辰朗迪GEO
英辰朗迪GEO 由 大勇学长 创立,专注于 GEO(生成式引擎优化)研究与 AI 获客实战,持续追踪 AI 技术、商业与算力基建的交叉动态。


