База знаний с RAG: кидайте ссылки — AI запомнит и найдёт
Проблема: вы читаете, но не вспоминаете
Каждый день вы просматриваете десятки статей, твитов, видео. Часть из них сохраняете в закладки. Через неделю пытаетесь найти что-то конкретное — «та статья про память агентов» или «тред про эмбеддинги» — и ничего. Закладки превратились в свалку, а поиск по ним работает только по заголовкам.
RAG (Retrieval-Augmented Generation) решает эту проблему. Вы скидываете ссылку в чат — AI скачивает контент, нарезает на фрагменты, создаёт векторные эмбеддинги и сохраняет. Потом вы задаёте вопрос на естественном языке — и получаете ответ с источниками.
Как работает RAG
RAG — это не магия, а три простых этапа:
1. Индексация. Когда вы кидаете URL, AI извлекает текст (статьи, расшифровки видео, треды), нарезает его на чанки по 300–500 токенов и каждый чанк превращает в вектор — числовое представление смысла. Всё это хранится в векторной базе данных.
2. Семантический поиск. Когда вы спрашиваете «что я сохранял про memory у агентов?», ваш вопрос тоже превращается в вектор. Система ищет ближайшие по смыслу чанки — не по ключевым словам, а именно по смыслу. «Контекстное окно LLM» и «память языковой модели» найдутся, даже если этих слов в запросе нет.
3. Генерация с контекстом. Найденные фрагменты подаются в промпт LLM вместе с вашим вопросом. Модель формирует ответ и указывает источники — конкретные URL и фрагменты.
Что можно складывать
В персональную базу знаний можно загружать:
- URL статей и постов — AI скачает и проиндексирует текст
- Твиты и треды — извлекает текст даже из цепочек
- YouTube-видео — скачивается субтитры/транскрипт
- PDF-документы — парсится текст со страниц
- Просто заметки — любой текст, вбитый в чат
Формат не важен — главное, чтобы был URL или текст.
Как это выглядит в жизни
Выделите отдельный топик в Telegram (или канал в Slack) — назовите «knowledge-base» или «база знаний».
Сохранение: кидаете ссылку в топик. AI автоматически скачивает контент, индексирует и отвечает: «Записал: статья «Building Agents with Memory», 12 чанков».
Поиск: пишете вопрос в тот же топик: «Что у меня про эмбеддинги?». AI ищет по семантике, возвращает топ-результаты с фрагментами и ссылками на оригиналы.
Интеграция: другие воркфлоу могут автоматически обращаться к базе. Например, пайплайн генерации видео-идей запросит релевантный контент при подготовке исследовательских карточек.
Векторные эмбеддинги — зачем они
Поиск по ключевым словам (как в обычных закладках) не понимает смысл. Запрос «как агенты запоминают контекст» не найдёт статью «Persistent Memory in LLM Systems» — слова разные.
Эмбеддинги решают это. Модель (например, OpenAI text-embedding-3-small или open-source BGE) преобразует текст в вектор из 1536 или 768 чисел. Тексты с похожим смыслом оказываются близко в этом пространстве. Поиск — это просто нахождение ближайших векторов (cosine similarity).
Это тот же принцип, который используют ChatGPT с Plugins, Perplexity и другие RAG-системы. Только у вас — персональная база, которая растёт со временем.
Настройка: пошагово
Вот минимум для запуска:
- Установите скилл knowledge-base (или соберите свой RAG на эмбеддингах)
- Создайте Telegram-топик «knowledge-base»
- Настройте промпт на автоматическую индексацию при получении URL
- Настройте семантический поиск при получении вопроса
- Проверьте: киньте 5–10 ссылок, задайте пару вопросов
Промпт для настройки
Используйте этот промпт, чтобы настроить автоматическую работу базы:
When I drop a URL in the "knowledge-base" topic:
1. Fetch the content (article, tweet, YouTube transcript, PDF)
2. Ingest it into the knowledge base with metadata (title, URL, date, type)
3. Reply with confirmation: what was ingested and chunk count
When I ask a question in this topic:
1. Search the knowledge base semantically
2. Return top results with sources and relevant excerpts
3. If no good matches, tell me
Also: when other workflows need research (e.g., video ideas, meeting prep),
automatically query the knowledge base for relevant saved content.
Практические советы
- Отдельный топик — не смешивайте с рабочим чатом, иначе AI будет путать команды с контентом
- Метаданные важны — просите AI сохранять URL, дату, тип контента. Потом будете фильтровать
- Регулярно наполняйте — база полезна только если в ней достаточно контента. 50–100 статей — хороший старт
- Используйте в других воркфлоу — база знаний не изолирована. Пайплайны генерации контента, подготовки к встречам, написания постов — всё может запрашивать вашу базу
- Тестируйте поиск — после первых 10–15 сохранений попробуйте разные формулировки вопросов, чтобы убедиться, что семантика работает
Что под капотом
Техническая реализация обычно выглядит так:
- Парсинг: web_fetch + readability для статей, API для твитов, youtube-transcript-api для видео
- Чанкинг: нарезка текста на фрагменты по 300–500 токенов с перекрытием ~50 токенов
- Эмбеддинги: OpenAI text-embedding-3-small, Cohere embed-v3 или open-source модели (BGE, E5)
- Хранение: векторная база — ChromaDB, Qdrant, Milvus или даже простой FAISS-индекс
- Поиск: cosine similarity, возврат top-K результатов с порогом релевантности
Всё это можно обернуть в один скилл и не думать о реализации.
Скачать скилл
Скачать скилл (Markdown)
# Персональная база знаний (RAG)
Вы читаете статьи, твиты и смотрите видео весь день, но не можете найти ту самую вещь, которую видели на прошлой неделе. Закладки копятся и становятся бесполезными.
Этот воркфлоу строит searchable-базу знаний из всего, что вы сохраняете:
• Скиньте любой URL в Telegram или Slack — контент автоматически загружается (статьи, твиты, транскрипты YouTube, PDF)
• Семантический поиск по всему сохранённому: «Что я сохранял про память агентов?» возвращает ранжированные результаты с источниками
• Интегрируется с другими воркфлоу — например, пайплайн генерации видео-идей запрашивает базу знаний для поиска релевантного контента при сборке исследовательских карточек
## Необходимые скиллы
- Скилл [knowledge-base](https://clawhub.ai) (или собственный RAG на эмбеддингах)
- `web_fetch` (встроенный)
- Telegram-топик или Slack-канал для загрузки контента
## Как настроить
1. Установите скилл knowledge-base из ClawdHub.
2. Создайте Telegram-топик «knowledge-base» (или используйте Slack-канал).
3. Задайте промпт OpenClaw:
```text
Когда я скидываю URL в топик «knowledge-base»:
1. Скачивай контент (статья, твит, транскрипт YouTube, PDF)
2. Загружай в базу знаний с метаданными (название, URL, дата, тип)
3. Отвечай подтверждением: что загружено и количество чанков
Когда я задаю вопрос в этом топике:
1. Ищи по базе знаний семантически
2. Возвращай топ-результаты с источниками и релевантными фрагментами
3. Если нет хороших совпадений — скажи мне
Также: когда другим воркфлоу нужны исследования (например, видео-идеи, подготовка к встречам), автоматически запрашивай базу знаний для релевантного сохранённого контента.
```
4. Проверьте: скиньте несколько URL и задайте вопросы вроде «Что у меня про LLM memory?»
Итого
Персональная база знаний с RAG — это закладки, которые реально работают. Вы скидываете ссылки, AI индексирует и понимает смысл. Через месяц у вас — searchable-архив всего, что вы читали. Никаких потерянных статей, никаких «я точно это видел, но не могу найти».
Семантический поиск по векторным эмбеддингам находит то, что не может найти grep или обычный поиск. Это одна из самых практически полезных вещей, которые можно сделать с LLM-агентом.