Mixture-of-Experts (Moe), Explained: Why "Active Parameters" Decide What Runs
深度解析 MoE 架构中 “总参数” 与 “激活参数” 的区别,解释为何 671B 模型能跑出 37B 的速度。
MoE 总参数管内存、激活参数管速度,买大内存盒子就能跑出像 3B 的快速大模型,Qwen35B-A3B 直接抄来本地跑 agentic coding
2026 年 6 月 12 日 · 星期五
读过 150 篇 · 精选 30 篇
深度解析 MoE 架构中 “总参数” 与 “激活参数” 的区别,解释为何 671B 模型能跑出 37B 的速度。
MoE 总参数管内存、激活参数管速度,买大内存盒子就能跑出像 3B 的快速大模型,Qwen35B-A3B 直接抄来本地跑 agentic coding
本文通过一个 Next.js 缓存失效实验,探讨了顶级 AI 模型在编程时倾向于过度设计(Overengineering)而非遵循 KISS 原则的现象。
Fable 5 模型用 tags + revalidateTag 修复了缓存失效 bug,方案更通用但比 revalidatePath 多了点架构
一个无需注册和 API Key 的免费社交媒体数据 API,支持一键获取 X、YouTube、TikTok 等 8 个平台的互动指标。
免费 API 单调用就能拿到 YouTube X TikTok 等社交帖子实时数据,贴给 agents 就能直接用
基于 Typst 的零配置 Markdown 转 PDF 工具,无需安装 LaTeX 或 Pandoc 即可生成专业技术报告。
零配置把 README.md 变成带目录的 IEEE PDF,纯 Python 无 LaTeX 依赖
专为 Windows 设计的 Claude Code 终端工作区管理器,通过 TUI 强化多项目会话管理与上下文维护。
Windows Claude Code 多项目工作区管理器,终端 UI 管会话搜索恢复、自动维护 CLAUDE.md 和 MCP 文档
为 AI Agent 提供本地优先、可跨 Session 持续进化的长短期记忆管理工具。
opendream init 一键激活,支持多 agent 共享本地可审阅 workspace 记忆
AI 正在实现递归式自我改进,Anthropic 披露其 80% 以上的代码现已由自家 AI 编写。
Claude Code 让 AI 自主写了 4 / 5 代码,递归自我改进成真了
探讨会计学术研究为何因过度依赖大数据而导致对现实商业的解释力大幅下降。
大样本数据让会计研究发现效果小到只有 1990 年代一半,但这正是给创业的深度洞见:手动收集数据聚焦大 M 效应
深度分析 AI 投资泡沫破裂的潜在后果,指出其演变路径更接近 2000 年互联网泡沫而非 2008 年金融危机。
AI 泡沫破裂更像 dot-com 崩盘而非 2008,数据中心支出崩或拖累经济但杠杆低冲击有限
探讨在 NVFP4 等两级缩放数值格式中,为何块缩放(Block Scale)的精度比范围更重要。
NVFP4 张量级 FP32 标尺帮块尺度专注相对幅度,优化 AI 推理量化
深度探讨为何 AI 提示词界面是交互设计的 “大倒退”,以及为何未来的 AI 交互必须从 “文字描述” 回归 “视觉操作”。
提示不是界面,AI 强制设计师从绘制转向打字,视觉信息丢失惨重
OpenAI 更新服务条款,新增 “许可材料” 相关规定,暗示其正在筹备本地化部署(On-Prem)产品。
OpenAI 为本地部署产品铺路,合同要求终止后永久删除所有副本,退出成本得提前算
汇总了 AI 机器人学原理、生物制药中的 “反规模效应”、DeepMind 科学家求职经验及 R 语言新工具等前沿技术与职业发展资讯。
物理 AI 把机器人模型扔进动态世界多了推理时间这根轴,生物反 scaling 观点直接戳穿药物开发乐观泡沫
PAX ERP 公开文档提供 .md 原始版 + llms.txt 索引 + 完整 bundle,让 AI 系统直接读取无需视觉界面,附带 Paxy AI 案例,适合想让 AI 辅助 ERP 文档的团队参考。
PAX ERP 给 AI 准备了 llms.txt 索引和 .md 完整包,帮代理直接读懂文档一步到位
在通用计算机使用 Agent 评测中,模型能力对成绩的影响远超框架设计,精简框架 ALE-Claw 在保持同等准确率的同时显著降低了成本与耗时。
ALE-Claw 用极简 harness 在 ALE 上和 OpenClaw 一样准,却省下大半成本时间
揭秘 BYUCTF 2026 如何通过禁赛 65 支作弊战队才凑齐前十名,并探讨了 OSINT 挑战在 AI 时代作为 “反作弊” 防线的独特价值。
BYUCTF 为了公平直接 ban 65 队,才把 top 10 留给干净选手
揭示 Bun 和 Node.js 在处理 SQLite 参数化查询时,因数值绑定逻辑差异导致计算结果不一致的技术细节。
Bun 与 Node SQLite 参数绑定行为不同,整数查询结果会不一致
由伯克利 RDI 联合 300 多位专家推出的 AI Agent 大规模评测基准,聚焦 55 个细分行业的真实工作流。
Agents' Last Exam 只是个 AI 代理基准推广,啥干货都没给
介绍 GEDD,一个面向 AI PM 和领域专家的 AI Agent 评估工作台,旨在通过 “扎根理论” 将专家的人工评估转化为可落地的自动化评测标准。
GEDD 用场景驱动让 AI 产品经理直接标注专家语言错误
探讨 API 设计中 “宁可返回空,也不要靠猜测” 的原则,通过作者删除 PostgreSQL 解析器中启发式代码的案例,说明确定性对系统可靠性的重要性。
无 schema 就直接空,而不是猜 SQL 外键关系
加拿大隐私专员裁定 X Corp. 和 xAI 违反隐私法,因其 Grok 机器人生成了大量未经授权的性暗示深伪内容。
Grok 图像生成被滥用生成数百万 deepfake,加拿大隐私专员裁定 xAI 未获有效同意且 safeguards 不足
本文介绍了如何构建一个具备 “持久化” 能力、能从失败中恢复并根据任务类型(查找/提取/综述)自动路由的深度搜索智能体。
一个开源的 Bull 和 BullMQ 队列管理面板,支持独立运行或嵌入到主流 Web 框架中。
Bullstudio 嵌入框架适配器,Next.js 零配置暴露队列实时看管
介绍专为 AI Agent 设计的分析型数据库 RawTree,主打 “先入库后建模”,支持根据查询模式自动优化物理结构。
RawTree 直接 ingest JSON 就开表查 SQL,自动建索引,完美适配 AI 代理数据没 schema 的场景
一项针对 2.5 万条视频的分析显示,大众对 AI 的关注点与精英阶层严重脱节:社交媒体用户更在意 AI 模因和创意侵权,而非宏大的末日论或文明变革。
TikTokYouTubers 把 AI 当日常生产力乐趣,3:1 采用压倒质疑,远超精英叙事
NVIDIA 推出 LocateAnything 框架,通过 “并行框解码” 技术将 VLM 视觉定位速度提升 10 倍并保持高精度。
Parallel Box Decoding 让 VLM 视觉定位一键并行解框,速度准度双翻倍
GitLab 发布一系列 “智能体基础设施” 更新,包括提速 50 倍的新一代 SCM 引擎和旨在减少 AI 幻觉的上下文图谱 GitLab Orbit。
Orbit 上下文图让 AI 代理从碎片化变成全生命周期决策,Compare the Market 实测评论位置准确率 70%
介绍一种将长文本渲染为高密度像素 PNG 图片的上下文压缩技术,在降低约 2 / 3 Token 成本的同时保持近乎 100% 的信息召回率。
Snapcompact 把上下文塞进图片直接传给模型,F1 依然 0.86–0.96 还省三分之二 token
OpenCode Data 页面展示最近 3 个月国内 AI 模型在 OpenCode Go 平台上的实时使用数据,包括 Top 模型排行、周变化、成本与缓存比例,适合关注模型生态与市场动态的读者参考。
中文 AI 模型使用数据:1T 模型占主导,Zhipu MiniMax Qwen 合计占 69%+
面对 AI 带来的职业焦虑,作者通过回顾过去 20 年技术变革的起伏,指出 “个人效率提升将取代团队” 的预言往往并不会完全成真。
AI 替整个团队抢饭饭,过去 20 年全被证伪,Ruby on Rails 至今还活得很好
读完去做事。