Memory

本地长记忆

Try it

面向隐私敏感与离线场景的本地向量记忆系统。基于 LanceDB + 纯本地 embedding(Ollama/nomic-embed-text),实现零外部 API 调用、零数据出域、完全离线可用的语义记忆检索。 核心能力包括本地 embedding 引擎(Ollama nomic-embed-text,毫秒级延...

What it does

面向隐私敏感与离线场景的本地向量记忆系统。基于 LanceDB + 纯本地 embedding(Ollama/nomic-embed-text),实现零外部 API 调用、零数据出域、完全离线可用的语义记忆检索。 核心能力包括本地 embedding 引擎(Ollama nomic-embed-text,毫秒级延迟)、LanceDB 向量库(本地 SQLite 存储)、embedding 结果缓存(避免重复计算)、WAL 写前日志、三层冷热分层、资源占用控制(内存上限/压缩/清理)、一键初始化与维护命令。 适用场景:隐私敏感行业(医疗/金融/法律)、离线/弱网环境、个人知识库、合规要求数据不出域的企业 Agent、希望零 API 成本运行的独立开发者。 差异化:相比云端 embedding 方案,本系统完全本地运行零 API 费用、数据永不离开本机、离线可用;相比简单文件记忆,提供向量语义检索召回更准;新增 embedding 缓存避免重复计算、资源占用控制防止内存膨胀、模型选择指南平衡质量与速度。指令精简分层,降低 token 消耗。 触发关键词:本地记忆、向量记忆、离线记忆、隐私记忆、embedding、LanceDB、Ollama、nomic、本地向量、local memory

The skill document

本地长记忆(LocalMemo Pro)

零 API、零云端、零数据出域的本地向量记忆系统。基于 Ollama + LanceDB,在本地完成 embedding 生成与语义检索,适合隐私敏感、离线、成本敏感场景。

痛点与对策速查

用户痛点发生场景本系统对策
数据隐私担忧云端 embedding 数据出域纯本地 Ollama embedding,数据不出本机
API 费用高云端 embedding 按 token 收费本地 nomic-embed-text 完全免费
离线不可用无网络时记忆系统瘫痪本地运行,完全离线可用
重复计算浪费相同文本反复生成 embeddingembedding 结果缓存,命中即返回
内存膨胀向量库无限增长占满内存资源占用控制 + 压缩 + 清理
质量担忧本地模型不如云端提供模型选择指南,质量够用且可切换
部署复杂本地栈搭建门槛高一键初始化 + 详细故障排查

本地 vs 云端对比

对比维度云端 API(OpenAI)本地方案(Ollama)
费用按 token 收费完全免费
延迟网络往返 100-500ms本地 10-50ms
隐私数据出域完全本地
离线不可用完全可用
质量text-embedding-3-largenomic-embed-text(足够)
资源占用零本地资源需 2-4GB 内存
部署难度仅需 API Key需安装 Ollama

结论:个人/小团队/隐私场景用本地;追求极致质量且不敏感数据用云端。

架构

┌───────────────────────────────────────────────────────────────┐
│                   LOCALMEMO PRO 本地架构                        │
├───────────────────────────────────────────────────────────────┤
│                                                                │
│  L1 热内存     SESSION-STATE.md    活跃任务上下文(抗压缩)     │
│      ↓                                                         │
│  L2 温向量     LanceDB            本地向量检索(embedding缓存)│
│      ↓         ↑ embedding 由 Ollama 本地生成                  │
│  L3 冷存储     Git-Notes          结构化决策(永久)           │
│      ↓                                                         │
│  L4 精选归档   MEMORY.md + daily/ 人类可读长期记忆             │
│                                                                │
│  全程零外部 API · 零数据出域 · 离线可用                        │
└───────────────────────────────────────────────────────────────┘

快速开始(3 步)

第 1 步:安装本地 embedding 引擎

# 安装 Ollama
# macOS/Linux
curl -fsSL https://ollama.com/install.sh | sh

# Windows: 从 https://ollama.com/download 下载安装包

# 拉取 embedding 模型(约 274MB)
ollama pull nomic-embed-text

# 验证
ollama --version

第 2 步:初始化记忆系统

cd skills/localmemo-pro
npm install
node bin/init.js

初始化创建:

  • SESSION-STATE.md — 热内存
  • MEMORY.md — 长期记忆
  • memory/ — 每日日志目录
  • memory/vectors/ — LanceDB 向量数据库
  • memory/cache/ — embedding 缓存目录

第 3 步:使用记忆工具

# 存储
node bin/memory.js store "用户喜欢深色模式" --importance 0.9 --category preference

# 搜索
node bin/memory.js search "用户界面偏好"

# 统计
node bin/memory.js stats

# 遗忘
node bin/memory.js forget --query "深色模式"

Embedding 缓存机制(差异化核心)

相同文本反复生成 embedding 是本地系统的主要性能瓶颈。本系统实现 embedding 缓存:

文本 → SHA256(文本) → 查缓存目录
                          ├─ 命中 → 直接返回向量(<1ms)
                          └─ 未命中 → Ollama 生成 → 写入缓存(10-50ms)
操作无缓存耗时有缓存耗时命中率(典型)
存储记忆30-50ms<1ms(命中)/ 30-50ms(未命中)70-90%
检索记忆30-50ms × N<1ms × N(命中)60-80%

缓存配置

{
  "embeddingCache": {
    "enabled": true,
    "path": "./memory/cache",
    "maxSizeMb": 500,
    "ttlDays": 90,
    "compression": true
  }
}

缓存达到上限时自动 LRU 淘汰最久未用的 embedding。

模型选择指南

模型大小维度质量速度推荐场景
nomic-embed-text274MB768中高通用推荐
bge-m31.2GB1024多语言/高质量需求
mxbai-embed-large670MB1024英文高质量
all-MiniLM-L690MB384极快资源受限设备

推荐:默认用 nomic-embed-text(质量/速度/大小均衡)。资源紧张用 all-MiniLM-L6,质量优先用 bge-m3。

WAL 写前日志协议

原则:先写状态,再回复用户。 保证崩溃/压缩时不丢上下文。

触发条件写入位置写入时机
用户表达偏好SESSION-STATE.md + memory store回复前
用户做出决策SESSION-STATE.md + Git-Notes回复前
用户给出期限SESSION-STATE.md回复前
用户纠正错误SESSION-STATE.md + lessons.md回复前

资源占用控制(差异化核心)

本地系统最大风险:向量库无限增长导致内存/CPU/磁盘膨胀。

三级资源控制

级别触发条件控制措施
轻度向量数 > 10000自动压缩低重要性向量
中度磁盘 > 500MB归档 90 天前记忆到文件
重度磁盘 > 1GB告警 + 停止写入(仅检索)

维护命令

# 查看资源占用
node bin/memory.js stats --detailed

# 压缩向量库
node bin/memory.js compact

# 清理旧记忆
node bin/memory.js cleanup --before 30d

# 去重
node bin/memory.js dedup

# 导出备份
node bin/memory.js backup ./backups/memory-$(date +%Y%m%d).zip

# 清理 embedding 缓存
node bin/memory.js cache-clean --older-than 30d

Agent 配置集成

在 Agent 配置文件中启用本地记忆插件:

{
  "plugins": {
    "entries": {
      "localmemo-pro": {
        "enabled": true,
        "config": {
          "ollamaUrl": "http://localhost:11434",
          "embeddingModel": "nomic-embed-text",
          "dbPath": "./memory/vectors",
          "cachePath": "./memory/cache",
          "autoRecall": true,
          "autoCapture": false,
          "maxMemoryMb": 500,
          "minImportance": 0.5
        }
      }
    }
  }
}

启用后自动提供工具:

  • memory_recall — 搜索相关记忆
  • memory_store — 存储重要信息
  • memory_forget — 删除记忆

代理行为指令

会话开始时

  1. 读取 SESSION-STATE.md(热内存)
  2. 执行 memory_recall 搜索相关历史
  3. 检查 memory/YYYY-MM-DD.md 近期活动

对话进行中

情境动作
用户给出具体细节先写 SESSION-STATE.md,再回复
重要决策memory_store 存储
表达偏好memory_store --importance 0.9 --category preference
出现错误写入 lessons.md

会话结束时

  1. 更新 SESSION-STATE.md 最终状态
  2. 重要内容移至 MEMORY.md
  3. 创建/更新 memory/YYYY-MM-DD.md

真实场景示例

场景 1:医疗隐私场景

用户:"记录患者对青霉素过敏"
→ 本地 embedding 生成(数据不出域)
→ memory_store:"患者青霉素过敏" importance=1.0 category=medical
→ 存储在本地 LanceDB,符合 HIPAA 合规

后续查询:
  memory_recall query="患者过敏史"
  → 本地检索,零数据外传

场景 2:离线开发场景

环境:飞机上无网络,本地开发

用户:"上次我们怎么解决 CORS 问题的?"
→ memory_recall query="CORS 跨域解决"
→ 本地 Ollama 生成 query embedding(离线)
→ LanceDB 本地检索
→ 召回:"CORS 用代理中间件解决,配置在 middleware/cors.js"
→ 无需网络即可回忆历史决策

场景 3:成本敏感场景

独立开发者,月 API 预算 $0

存储 1000 条记忆:
  云端方案:embedding 费用约 $0.5-1/月
  本地方案:$0(一次性模型下载 274MB)

检索 100 次/天:
  云端方案:embedding 费用约 $0.3/月
  本地方案:$0(embedding 缓存命中后 <1ms)

年度节省:约 $10-15

常见问题 FAQ

Q1:本地 embedding 质量够用吗? A:nomic-embed-text 在 MTEB 基准上表现接近 text-embedding-3-small,对个人/小规模记忆库完全够用。如需更高质量可切换 bge-m3。

Q2:Ollama 占多少内存? A:nomic-embed-text 运行时约 2-4GB 内存。资源紧张可用 all-MiniLM-L6(约 500MB)。

Q3:embedding 缓存会占多少磁盘? A:每条记忆的 embedding 约 3KB(768 维 float32)。10000 条记忆约 30MB,缓存上限可配置(默认 500MB)。

Q4:能和云端方案混用吗? A:可以。重要记忆用云端高质量 embedding,日常用本地。但需注意维度一致性,建议统一用一种。

Q5:向量库损坏怎么办? A:定期 node bin/memory.js backup 备份。损坏后从备份恢复,或从 MEMORY.md + daily/ 重建(记忆内容仍在文件中)。

故障排查

现象排查步骤解决方案
Ollama 连接失败curl http://localhost:11434/api/tagsollama serve 启动服务
模型未找到ollama listollama pull nomic-embed-text
向量搜索无结果node bin/memory.js stats确认已存储记忆;检查 dbPath
内存占用过高node bin/memory.js stats --detailed运行 compact + cleanup
embedding 速度慢检查缓存命中率确认 cache.enabled=true
磁盘满检查 vectors/ 和 cache/ 大小清理缓存 + 归档旧记忆
检索质量差检查 minScore 设置降低 minScore 到 0.25;换更大模型

文件结构

workspace/
├── SESSION-STATE.md          # 热内存
├── MEMORY.md                 # 精选长期记忆
├── memory/
│   ├── vectors/              # LanceDB 向量库
│   ├── cache/                # embedding 缓存
│   ├── 2026-07-18.md         # 每日日志
│   ├── lessons.md            # 教训记录
│   └── topics/               # 主题文件
├── bin/
│   ├── init.js               # 初始化脚本
│   └── memory.js             # 记忆管理 CLI
└── localmemo-config.json     # 配置文件

依赖说明

运行环境

  • Agent 平台:支持 SKILL.md 的任意 AI Agent(Claude Code / Cursor / Codex / Gemini CLI 等)
  • 操作系统:Windows / macOS / Linux
  • Node.js:16+(运行记忆管理脚本)
  • 内存:建议 8GB+(Ollama 运行需 2-4GB)
  • 磁盘:建议 2GB+ 可用空间

第三方依赖

依赖项类型是否必需获取方式
LLM APIAPI必需由 Agent 内置 LLM 提供
Ollama本地推理引擎必需https://ollama.com/install
nomic-embed-textembedding 模型必需ollama pull nomic-embed-text
LanceDB向量数据库必需npm install vectordb
Git版本控制可选用于 Git-Notes 冷存储

API Key 配置

  • 本 Skill 核心功能无需任何 API Key
  • 完全本地运行,零外部 API 调用
  • 如需可选的云端备份功能,另行配置对应服务 Key

可用性分类

  • 分类:MD+EXEC(Markdown 指令 + exec 命令行执行)
  • 说明:基于 Markdown 的 AI Skill 驱动 Agent 执行本地记忆管理。核心记忆协议纯 Markdown 可工作;向量检索、embedding 生成需 Ollama + LanceDB 环境。

Related skills

AI 说"我记得",你敢信吗?测一下就知道。长期记忆评测台 memory-bench——本地一键评测智能体/大模型长期记忆:12 类题型(时序/实体/否定/反事实/跨会话整合),EM/F1 标准评分,零配置开箱即跑;可接真实 LLM 严评(SiliconFlow/DeepSeek),密钥 env 注入不落盘。结果可复现、可对比、可入发布证据。自带安全稳定性 10 维实测全 5.0。适合 Agent 开发者、AI 产品经理、记忆方案选型。"记忆好不好,测了才知道。"

自动记忆维护与知识提炼流水线:WAL写前日志→MEMORY.md→每日日志→Obsidian同步,含Insight Miner数据分析和双链发现

基于移动云 mem0 自部署服务的长期记忆系统,在开源项目基础上添加诸如记忆防护、记忆脱敏、用户画像等高阶特性。支持语义搜索和完整 CRUD 操作。 用于处理所有与记忆相关的操作,包括存储、搜索、列出、获取、更新、删除用户记忆。当用户说出"我名字叫..."、"我喜欢..."或询问"我有哪些记忆"时,必须使用此技能。

2 installs

基于扩散激活的联想记忆系统,通过神经图谱实现基础持久化召回。Use when 需要提升效率、自动化流程、批量处理、工作流优化时使用。不适用于需要人工创意判断的任务。适用于独立开发者、企业团队和自动化工作流场景。支持中文交互,无需复杂配置即开即用。输出结果可直接使用,减少二次加工成本。提供结构化输出和错误处理机制。

元忆 —— 有权限边界的文件式智能体记忆。文件式、零依赖、可 diff/可回滚:让任何 AI 智能体活过会话,开工 recall 恢复上下文、重要信息 remember 落盘、收工归档。类型体系 FACT(公共共享)/ PREF / BOUND / COMMIT(私密隔离)。触发:记住、别忘了、记一笔、记忆、remember、recall、跨会话、上次说到、续测、交接、归档、记忆盘、共享记忆、局域网记忆、画像、开工上下文、记忆守则、profile、context、越用越懂、语义检索、反馈、维护、蒸馏、feedback、maintain、distill、explain、自我学习、自我进化、自我提升、查看平台分页、recall 候选预过滤、任务相关记忆、--focus、--embedding、压缩遗忘、consolidate、周期摘要、自动合并、分类型衰减、回滚

2 installs1 stars

适用于需要memo quickstart相关能力的开发场景,包含结构化的工作流程和可复用的模板,帮助用户快速完成任务并保持代码质量.该技能适用于相关开发场景,包含结构化流程和配置说明.经过深度差异化处置,针对用户反馈和使用痛点进行了改进,提升了实用性和可操作性。零依赖本地记忆基础版:三层架构+TF-IDF检索+WAL日志,10秒上手.面向零依赖场景的本地记忆系统基础版,解决搜索精度不足与上手门槛高两大痛点. 三层记忆架构(热内存/冷存储/人类可读,提供.

1 installs