1、Google开源DiffusionGemma:用文本扩散实现4倍推理加速 26B MoE架构仅激活3.8B参数,H100上达到1000+ tokens/秒。核心是同时生成256个token,把瓶颈从内存带宽转到计算。双向注意力适合代码补全等非线性任务,但质量低于Gemma 4,定位是本地低并发的实验模型。 官方介绍:https://blog.google/innovation-and-ai/technology/developers-tools/diffusion-gemma-faster-text-generation/
2、Apodex-1:多Agent深度研究框架 核心设计是用编排器+子Agent+全局验证器的团队架构取代单Agent循环,单任务可协调150个子Agent执行15000步。在BrowseComp(90.3)、DeepSearchQA(94.4)等基准上超过GPT-5.5-pro和Claude-Opus-4.8。开源的4B小模型也超越所有30B级开源模型。 Github:https://github.com/ApodexAI/AgentHarness
3、Cohere开源语音识别模型:cohere-transcribe-03-2026 2B参数,语音识别准确度比较高,识别速度也几乎是实时。缺点是不支持多语言混合识别,中文识别的准确度也低于Qwen3-ASR。 模型:https://huggingface.co/CohereLabs/cohere-transcribe-03-2026
4、Baichuan-M4:百川发版的诊疗Agent 包含三大核心: Baichuan-Harness:负责行为约束、工具调用、患者长期记忆管理及多智能体协同; 推理模型:基于连续性诊疗强化学习框架训练 临床工具层:支持患者档案管理、权威循证检索,以及涵盖文档、X光影像和皮肤科图像的多模态医疗视觉能力 论文:https://arxiv.org/abs/2606.08982
我开源的Skill 1)原生PPT Skill。适用于任何模型和Agent,使用内置PPT模板生成豪华、可编辑的PPT。 Github:‣ 2)图片PPT转可编辑PPTX文档。可以把GPT和Banana生成的图片还原为可编辑的PPTX文档。 Github:https://github.com/GordenSun/GordenSuperPPTSkills
我的公众号:AI加速派 分享国内可以直接操作的前沿教程,而且教程里的token和key我都承包了,你甚至不用注册账号就能跑通。
