GH Repository · gokayfem
awesome-vlm-architectures
Curated visual catalog of 155+ vision-language model (VLM/MLLM) architectures: papers, diagrams, training recipes, datasets, and a release timeline for multimodal AI agents.
- stars
- 1,313
- 30-day movement
- +10/day
- Related entries
- 60
- Connections
- 1
vlmmultimodalawesomeresearch-papersawesome-listai-agentsvision-language-modelstransformersarchitecture-diagramsmllmarxivdeep-learningMarkdownlarge-multimodal-modelsfoundation-modelscomputer-visionmultimodal-aimultimodal-llmrelease-timelinemodel-architecturenatural-language-processing
awesome-vlm-architectures is a curated awesome-list cataloging 155+ vision-language model (VLM/MLLM) architectures. It collects papers, architecture diagrams, training recipes, datasets, and a release timeline, all in Markdown under a CC0-1.0 license.
Reach for it when you need a single organized reference to survey how vision-language models are structured and have evolved over time.
Use it to
- Browse architecture diagrams before designing a multimodal model
- Find arXiv papers for specific VLM architectures
- Compare training recipes and datasets across models
- Trace model releases via the timeline
- Use it as a starting point for literature review
For Researchers and engineers studying multimodal model architectures
- Role
- awesome-list
- Language
- Markdown
- Licence
- CC0-1.0
- Forks
- 55
- Last push
- 2026-07-31
topicsvision-language-modelsawesome-listmultimodalarchitecture-diagramsresearch-paperscomputer-vision