BigHugger
GH Repository · gokayfem

awesome-vlm-architectures

Curated visual catalog of 155+ vision-language model (VLM/MLLM) architectures: papers, diagrams, training recipes, datasets, and a release timeline for multimodal AI agents.

stars
1,313
30-day movement
+10/day
Related entries
60
Connections
1
vlmmultimodalawesomeresearch-papersawesome-listai-agentsvision-language-modelstransformersarchitecture-diagramsmllmarxivdeep-learningMarkdownlarge-multimodal-modelsfoundation-modelscomputer-visionmultimodal-aimultimodal-llmrelease-timelinemodel-architecturenatural-language-processing

awesome-vlm-architectures is a curated awesome-list cataloging 155+ vision-language model (VLM/MLLM) architectures. It collects papers, architecture diagrams, training recipes, datasets, and a release timeline, all in Markdown under a CC0-1.0 license.

Reach for it when you need a single organized reference to survey how vision-language models are structured and have evolved over time.

Use it to

  • Browse architecture diagrams before designing a multimodal model
  • Find arXiv papers for specific VLM architectures
  • Compare training recipes and datasets across models
  • Trace model releases via the timeline
  • Use it as a starting point for literature review

For Researchers and engineers studying multimodal model architectures

Role
awesome-list
Language
Markdown
Licence
CC0-1.0
Forks
55
Last push
2026-07-31
topicsvision-language-modelsawesome-listmultimodalarchitecture-diagramsresearch-paperscomputer-vision