VLM Backends (reanimator.backends)#
Interchangeable Vision-Language Model backends for page OCR and layout extraction.
OpenAIVisionBackend#
class OpenAIVisionBackend(
model: str = "rednote-hilab/dots.mocr",
base_url: Optional[str] = None,
api_key: Optional[str] = None,
max_tokens: int = 4096,
use_structured_layout: bool = True,
)
GeminiBackend#
class GeminiBackend(
model: str = "gemini-2.0-flash",
api_key: Optional[str] = None,
use_structured_layout: bool = True,
)
CachedBackend#
class CachedBackend(
backend: VLMBackend,
cache_dir: Union[str, Path] = "./.md_cache",
)
Wraps any VLM backend with disk-backed JSON caching. Prevents redundant API calls on repeated runs.