simple_vlm

A minimal Vision Language Model (VLM) implementation built from scratch in PyTorch, extending LLM capabilities with visual understanding. Features cross-modal attention, vision encoder, and complete training pipeline.

// repository documentation