# Research — VideoDB

> Papers, evaluations, and technical reports from the VideoDB team on video retrieval, persistent visual memory, and multimodal models.

---

## Technical reports

### [Search over the Visual World: Persistent Visual Memory, Layered Indexes, and Source-Grounded Evidence](https://videodb.io/research/search-over-the-visual-world)
Nagaonkar, Garg, Raj, Choithani, Trivedi · VideoDB Technical Report · July 2026
A formal model of search over continuously growing visual corpora, plus a complete-system comparison across 9,834 queries on four public benchmarks (MSVD, YouCook2, VATEX, MSR-VTT) where a pipeline of general-purpose components beats a commercial video-native engine on macro Recall@1/@3/@10 (73.09/83.39/91.20 vs 65.75/77.13/89.10). [PDF](https://labs.videodb.io/papers/search-over-the-visual-world.pdf)

## Peer-reviewed & preprints

- [Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding](https://arxiv.org/abs/2604.11177). arXiv, April 2026
- [Benchmarking Vision-Language Models on Optical Character Recognition in Dynamic Video Environments](https://arxiv.org/abs/2502.06445). arXiv, February 2025 · [code + dataset](https://github.com/video-db/ocr-benchmark)

## Research notes

- [What Video Retrieval Benchmarks Get Wrong About Ground Truth](https://videodb.io/blogs/video-benchmark-ground-truth-ambiguity). July 2026
- [JEPA: From Language Models to World Models](https://videodb.io/blogs/jepa-from-language-models-to-world-models). July 2026
- [How to Evaluate Multimodal VLMs for Your Video Use Case](https://videodb.io/blogs/how-to-evaluate-multimodal-vlms-for-your-video-use-case). May 2026
- [Strong VLMs Can Still Fail on Downstream Vision Tasks](https://videodb.io/blogs/claude-chessboard-spatial-reasoning). May 2026
