thinkingmachines/Inkling
image-text-to-text · transformers, safetensors, inkling_mm_model
Home / 👁️ Multimodal / VLM
46 View all · Daily curated AI / LLM open-source intelligence, with plain-language notes and license checks.
image-text-to-text · transformers, safetensors, inkling_mm_model
image-text-to-text · transformers, safetensors, unlimited-ocr
image-text-to-text · transformers, safetensors, qwen3_5_moe
image-text-to-text · transformers, safetensors, diffusion_gemma
image-text-to-text · transformers, safetensors, step3p7
image-text-to-text · transformers, safetensors, qwen3_5
image-text-to-text · transformers, safetensors, qwen3_5
any-to-any · transformers, safetensors, gemma4_unified
any-to-any · Lance, safetensors, multimodal
text-generation · transformers, safetensors, qwen3_5_moe
image-text-to-text · PaddleOCR, safetensors, paddleocr_vl
image-text-to-text · transformers, safetensors, kimi_k25
any-to-any · transformers, safetensors, gemma4_unified
image-text-to-text · transformers, safetensors, KeyeVL2
text-generation · transformers, safetensors, gemma4_unified
image-text-to-text · transformers, safetensors, minicpmv4_6
image-to-text · transformers, safetensors, image-text-to-text
image-to-text · PaddleOCR, safetensors, pp_ocrv6_medium_det
· task_categories:any-to-any, language:en, license:cc-by-nc-4.0
· gradio, region:us
· gradio, build-small-hackathon, document-ai
· gradio, region:us
image-text-to-text · transformers, safetensors, gemma4
· gradio, region:us
image-text-to-text · transformers, safetensors, locateanything
· docker, research-article-template, research paper
· gradio, region:us
· task_categories:visual-question-answering, task_categories:image-to-text, language:en
· task_categories:image-to-text, task_categories:visual-question-answering, task_categories:image-text-to-text
· gradio, region:us
· static, region:us
· gradio, flux, flux.2
· gradio, region:us
· language:en, license:mit, arxiv:2605.30341
· task_categories:image-to-text, language:vi, size_categories:10K<n<100K
· task_categories:text-generation, language:en, license:apache-2.0
· gradio, region:us
image-text-to-text · transformers, safetensors, qwen3_5
· gradio, region:us
· task_categories:question-answering, task_categories:multiple-choice, task_categories:visual-question-answering
· benchmark:official, benchmark:eval-yaml, language:en
· arxiv:2605.27978, region:us, uv-script
Official implementation of paper "VLM³: Vision Language Models Are Native 3D Learners".
Never stop coding. Free AI gateway: one endpoint, 160+ providers (50+ free), connect Claude Code, Codex, Cursor, Cline & Copilot to FREE Claude/GPT/Gemini. RTK+Caveman stacked compression saves 15-95% tokens, smart auto-fallback, MCP/A2A, multimodal APIs, Desktop/PWA.
不想啃 5000+ 全文?我已经替你和 LLM 啃完了 — ICLR 2026 全景中文导读
· task_categories:image-text-to-text, language:en, size_categories:1K<n<10K