VLM Backends (reanimator.backends)#

Interchangeable Vision-Language Model backends for page OCR and layout extraction.


OpenAIVisionBackend#

class OpenAIVisionBackend(
    model: str = "rednote-hilab/dots.mocr",
    base_url: Optional[str] = None,
    api_key: Optional[str] = None,
    max_tokens: int = 4096,
    use_structured_layout: bool = True,
)

GeminiBackend#

class GeminiBackend(
    model: str = "gemini-2.0-flash",
    api_key: Optional[str] = None,
    use_structured_layout: bool = True,
)

CachedBackend#

class CachedBackend(
    backend: VLMBackend,
    cache_dir: Union[str, Path] = "./.md_cache",
)

Wraps any VLM backend with disk-backed JSON caching. Prevents redundant API calls on repeated runs.