Vultr
VultronRetrieverPrime Qwen3.5 8B is a multimodal late-interaction retrieval model designed for visual document search and multilingual RAG across PDFs, scans, slides, and reports. It features 8B parameters, using a 32-layer hybrid GatedDeltaNet and full-attention architecture with 4,096 hidden size, 16 attention heads, and 320-dimensional multi-vector embeddings with MaxSim scoring. Supporting up to 262K context and 1,792 visual tokens, it delivers state-of-the-art retrieval accuracy while maintaining a compact index and efficient large-scale serving.
Vultr
VultronRetrieverCore Qwen3.5 4.5B is a multimodal late-interaction retrieval model designed for visual document search and multilingual RAG across PDFs, scans, slides, and reports. It features 4.5B parameters, using a 32-layer hybrid GatedDeltaNet and full-attention architecture with 2,560 hidden size, 16 attention heads, and 320-dimensional multi-vector embeddings with MaxSim scoring. Supporting up to 262K context and 1,792 visual tokens, it delivers state-of-the-art 4–5B retrieval performance while balancing retrieval accuracy, latency, and memory efficiency.
Vultr
VultronRetrieverFlash Qwen3.5 0.8B is a multimodal late-interaction retrieval model designed for visual document search and multilingual RAG across PDFs, scans, slides, and reports. It features 0.8B parameters, using a 24-layer hybrid GatedDeltaNet and full-attention architecture with 1,024 hidden size, 8 attention heads, and 320-dimensional multi-vector embeddings with MaxSim scoring. Supporting up to 262K context and 1,792 visual tokens, it delivers state-of-the-art sub-2B retrieval performance while maintaining low latency and memory efficiency.