RugBrain Architecture ๐ก Beta
Corpus (md/code) โโโถ Chunker โโโถ Dual embed โโโถ Qdrant collections
โ dense (4B deep) + sparse (BM25)
โผ
Query โโโถ Embed โโโถ Hybrid search โโโถ RRF fusion โโโถ Reranker โโโถ Top-k + sources
(dense + named-vector)
Dual-tier embeddingsโ
Two model sizes serve different jobs:
| Tier | Model | Latency | Use |
|---|---|---|---|
| Deep | qwen3-embedding-4b | ~120 ms/doc chunk | Ingestion, high-stakes queries |
| Fast | qwen3-embedding-0.6b | ~15 ms | Interactive search, agent loops |
Both run locally on CPU via llama.cpp โ no embedding API costs, no data leaves the box.
Why hybrid?โ
Pure vector search misses exact identifiers (getReserves, slot0). BM25 sparse
vectors restore lexical recall; RRF fusion keeps both recall curves. Measured +18%
hit rate on symbol-name queries in our eval set.