一句话个人技术博客,记录AI可解释性、稀疏自编码器、模型激活编辑与本地优先实验的复现实验和实现笔记。
定价免费内容 抓取内容未显示订阅、付费墙、商业定价或SaaS收费信息。
适合谁AI可解释性研究者、机器学习工程师、LLM安全/控制研究人员、关注本地模型实验与机制可解释性的技术读者
核心功能发布AI可解释性实验报告记录Sparse Autoencoder/SAE特征 steering 实验记录Natural Language Autoencoder在Gemma 3上的本地复现提供实验协议、指标、对照组和局限性说明部分文章链接项目仓库
AI能力与模型内容涉及google/gemma-3-12b-it、Gemma 3 12B NLA checkpoints、google/gemma-2-2b、Gemma Scope SAE、EleutherAI/pythia-70m-deduped等模型与检查点。实验方向包括Natural Language Autoencoder解释/编辑、Sparse Autoencoder特征控制、activation steering、logprob评估与本地MPS推理。
典型用例用于阅读和参考AI可解释性实验、复现本地模型激活提取/重构/注入流程、设计SAE steering控制实验、比较目标编辑与noop/unrelated/random/wrong-position等对照条件。
免费额度/试用抓取内容显示为公开个人博客文章,未提及账号、试用或额度。
定价未显示收费、订阅或商业定价。
中文支持抓取正文为英文,未看到中文界面或中文内容支持信息。
API与集成未提供产品API。文章提到项目仓库、命令行运行方式、Python模块与本地Transformers/MPS流程,但这是实验代码层面的实现信息,不是商业API集成。
数据隐私未说明网站隐私政策或数据处理。实验强调local-only、本地Mac/MPS路径、本地推理与本地运行开源/开放权重模型,说明部分实验不依赖云端推理。
输出质量与局限作者对结果表述谨慎:NLA编辑在窄诗歌任务上推动next-token logprob,但completion行为较弱;随机delta有时也能移动概率质量,限制因果特异性;SAE steering中code类别较稳,其他类别弱或不确定;实验样本量小、prompt合成、completion seed少。
中国访问未知
适用场景学习AI机制可解释性实验方法;参考SAE steering评估协议;复现Gemma/Pythia本地激活编辑实验;理解自然语言自编码器对LLM激活解释与编辑的局限。
同类Transformer Circuits、Anthropic interpretability blog、Gemma Scope相关资源、OpenAI/DeepMind等研究博客、个人开源SAE/可解释性实验仓库