Home / 👁️ Multimodal / VLM

👁️ Multimodal / VLM

46 View all · Daily curated AI / LLM open-source intelligence, with plain-language notes and license checks.

thinkingmachines/Inkling

image-text-to-text · transformers, safetensors, inkling_mm_model

🧱 AI Foundation Stack License unclear

baidu/Unlimited-OCR

image-text-to-text · transformers, safetensors, unlimited-ocr

🧱 AI Foundation Stack License unclear

stepfun-ai/Step-3.7-Flash

image-text-to-text · transformers, safetensors, step3p7

🧱 AI Foundation Stack License unclear

ATH-MaaS/OvisOCR2

image-text-to-text · transformers, safetensors, qwen3_5

🧱 AI Foundation Stack License unclear

moonshotai/Kimi-K2.7-Code

image-text-to-text · transformers, safetensors, kimi_k25

🧱 AI Foundation Stack ⚠ Non-commercial

google/gemma-4-12B

any-to-any · transformers, safetensors, gemma4_unified

🧱 AI Foundation Stack License unclear

kai-os/Grug-12B

text-generation · transformers, safetensors, gemma4_unified

🧱 AI Foundation Stack ⚠ Non-commercial

openbmb/MiniCPM-V-4.6

image-text-to-text · transformers, safetensors, minicpmv4_6

🧱 AI Foundation Stack License unclear

numind/NuExtract3

image-to-text · transformers, safetensors, image-text-to-text

🧱 AI Foundation Stack License unclear

google/gemma-4-31B-it

image-text-to-text · transformers, safetensors, gemma4

🧱 AI Foundation Stack License unclear

nvidia/LocateAnything-3B

image-text-to-text · transformers, safetensors, locateanything

🧱 AI Foundation Stack ⚠ Non-commercial

kepeng/MeasL-Bench-V1

· task_categories:visual-question-answering, task_categories:image-to-text, language:en

🧱 AI Foundation Stack ⚠ Non-commercial

Cognitive-Lab/NayanaOCR_Corpus_2025

· task_categories:image-to-text, task_categories:visual-question-answering, task_categories:image-text-to-text

🧱 AI Foundation Stack ⚠ Non-commercial

ProCreations/grug-think

· task_categories:text-generation, language:en, license:apache-2.0

🧱 AI Foundation Stack License unclear

MathLLMs/MathVision

· task_categories:question-answering, task_categories:multiple-choice, task_categories:visual-question-answering

🧱 AI Foundation Stack License unclear

allenai/olmOCR-bench

· benchmark:official, benchmark:eval-yaml, language:en

🧱 AI Foundation Stack License unclear

uv-scripts/ocr

· arxiv:2605.27978, region:us, uv-script

🧱 AI Foundation Stack License unclear

facebookresearch/VLM3

Official implementation of paper "VLM³: Vision Language Models Are Native 3D Learners".

🧱 AI Foundation Stack License unclear ★ 398

diegosouzapw/OmniRoute

Never stop coding. Free AI gateway: one endpoint, 160+ providers (50+ free), connect Claude Code, Codex, Cursor, Cline & Copilot to FREE Claude/GPT/Gemini. RTK+Caveman stacked compression saves 15-95% tokens, smart auto-fallback, MCP/A2A, multimodal APIs, Desktop/PWA.

🧱 AI Foundation Stack ✓ Commercial OK ★ 6,043

JenniferZhao0531/ICLR2026-Guide-CN

不想啃 5000+ 全文?我已经替你和 LLM 啃完了 — ICLR 2026 全景中文导读

🧱 AI Foundation Stack License unclear ★ 152

whale99/Interaction2Code

· task_categories:image-text-to-text, language:en, size_categories:1K<n<10K

🧱 AI Foundation Stack License unclear