simple_vlm
A minimal Vision Language Model (VLM) implementation built from scratch in PyTorch, extending LLM capabilities with visual understanding. Features cross-modal attention, vision encoder, and complete training pipeline.
// repository documentation
Was this content helpful?
(0 ratings)
