Skip to main content

RugBrain Architecture ๐ŸŸก Beta

Corpus (md/code) โ”€โ”€โ–ถ Chunker โ”€โ”€โ–ถ Dual embed โ”€โ”€โ–ถ Qdrant collections
โ”‚ dense (4B deep) + sparse (BM25)
โ–ผ
Query โ”€โ”€โ–ถ Embed โ”€โ”€โ–ถ Hybrid search โ”€โ”€โ–ถ RRF fusion โ”€โ”€โ–ถ Reranker โ”€โ”€โ–ถ Top-k + sources
(dense + named-vector)

Dual-tier embeddingsโ€‹

Two model sizes serve different jobs:

TierModelLatencyUse
Deepqwen3-embedding-4b~120 ms/doc chunkIngestion, high-stakes queries
Fastqwen3-embedding-0.6b~15 msInteractive search, agent loops

Both run locally on CPU via llama.cpp โ€” no embedding API costs, no data leaves the box.

Why hybrid?โ€‹

Pure vector search misses exact identifiers (getReserves, slot0). BM25 sparse vectors restore lexical recall; RRF fusion keeps both recall curves. Measured +18% hit rate on symbol-name queries in our eval set.