[{"slug":"autobench","name":"AutoBench","category":"automation","description":"Published Best for Work Automations (AutoBench) scores.","measures":"Published Best for Work Automations (AutoBench) scores.","limitation":"Scores are benchmark-specific and missing values are not estimated.","source":"https://www.vellum.ai/open-llm-leaderboard","publishedAt":"2026-08-29","entries":[{"model":"GLM 5.3 Flash","modelSlug":"z-ai-glm-5-3-flash","score":48.8,"rank":1,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/open-llm-leaderboard"},{"model":"Gemini 3.7 Flash","modelSlug":"google-gemini-3-7-flash","score":30.4,"rank":2,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"Claude Opus 5","modelSlug":"claude-opus-5","score":26,"rank":3,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"GPT-5.6 Sol","modelSlug":"openai-gpt-5-6-sol","score":18.1,"rank":4,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"Claude Fable 5","modelSlug":null,"score":17.4,"rank":5,"resolution":"unresolved","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"Claude Opus 4.8","modelSlug":null,"score":15.5,"rank":6,"resolution":"unresolved","sourceUrl":"https://www.vellum.ai/llm-leaderboard"}],"sourceUrl":"https://www.vellum.ai/open-llm-leaderboard"},{"slug":"browsecomp","name":"BrowseComp","category":"browsing","description":"Published Best in Browsing (BrowseComp) scores.","measures":"Published Best in Browsing (BrowseComp) scores.","limitation":"Scores are benchmark-specific and missing values are not estimated.","source":"https://www.vellum.ai/llm-leaderboard","publishedAt":"2026-08-25","entries":[{"model":"GPT-5.6 Sol","modelSlug":null,"score":92.2,"rank":1,"resolution":"unresolved","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"Kimi K3","modelSlug":null,"score":91.2,"rank":2,"resolution":"unresolved","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"Claude Opus 5","modelSlug":null,"score":90.8,"rank":3,"resolution":"unresolved","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"Claude Fable 5","modelSlug":"anthropic-claude-fable-5","score":88,"rank":4,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"DeepSeek V4 Flash","modelSlug":"deepseek-v4-flash","score":85.9,"rank":5,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"MiniMax M3","modelSlug":"minimax-minimax-m3","score":83.5,"rank":6,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/open-llm-leaderboard"},{"model":"DeepSeek V4 Pro","modelSlug":"deepseek-v4-pro","score":83.4,"rank":7,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/open-llm-leaderboard"},{"model":"Kimi K2.6","modelSlug":"moonshotai-kimi-k2-6","score":83.2,"rank":8,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/open-llm-leaderboard"}],"sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"slug":"swe-bench-verified","name":"SWE-Bench Verified","category":"coding","description":"Published Best in Agentic Coding (SWE Bench) scores.","measures":"Published Best in Agentic Coding (SWE Bench) scores.","limitation":"Scores are benchmark-specific and missing values are not estimated.","source":"https://www.vellum.ai/best-llm-for-coding","publishedAt":"2026-08-29","entries":[{"model":"GPT-5.6 Sol","modelSlug":"openai-gpt-5-6-sol","score":96.2,"rank":1,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/best-llm-for-coding"},{"model":"Claude Mythos 5","modelSlug":"claude-mythos-5","score":95.5,"rank":2,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/best-llm-for-coding"},{"model":"Claude Fable 5","modelSlug":"anthropic-claude-fable-5","score":95,"rank":3,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/best-llm-for-coding"},{"model":"GPT-5.6 Luna","modelSlug":null,"score":93,"rank":4,"resolution":"unresolved","sourceUrl":"https://www.vellum.ai/best-llm-for-coding"},{"model":"Claude Opus 4.8","modelSlug":null,"score":88.6,"rank":5,"resolution":"unresolved","sourceUrl":"https://www.vellum.ai/best-llm-for-coding"}],"sourceUrl":"https://www.vellum.ai/best-llm-for-coding"},{"slug":"osworld-verified","name":"OSWorld-Verified","category":"computer_use","description":"Published Best in Computer Use (OSWorld) scores.","measures":"Published Best in Computer Use (OSWorld) scores.","limitation":"Scores are benchmark-specific and missing values are not estimated.","source":"https://www.vellum.ai/open-llm-leaderboard","publishedAt":"2026-08-29","entries":[{"model":"Kimi K2.6","modelSlug":"moonshotai-kimi-k2-6","score":73.1,"rank":1,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/open-llm-leaderboard"},{"model":"MiniMax M3","modelSlug":"minimax-minimax-m3","score":70.1,"rank":2,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/open-llm-leaderboard"}],"sourceUrl":"https://www.vellum.ai/open-llm-leaderboard"},{"slug":"humanity-s-last-exam","name":"Humanity's Last Exam","category":"overall","description":"Published Best Overall (Humanity's Last Exam) scores.","measures":"Published Best Overall (Humanity's Last Exam) scores.","limitation":"Scores are benchmark-specific and missing values are not estimated.","source":"https://www.vellum.ai/llm-leaderboard","publishedAt":"2026-08-25","entries":[{"model":"Claude Opus 5","modelSlug":"claude-opus-5","score":64.7,"rank":1,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"Claude Mythos 5","modelSlug":"claude-mythos-5","score":64.5,"rank":2,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"Claude Opus 4.8","modelSlug":"claude-opus-4-8","score":57.9,"rank":3,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"Claude Sonnet 5","modelSlug":"claude-sonnet-5","score":57.4,"rank":4,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"Kimi K3","modelSlug":null,"score":56,"rank":5,"resolution":"unresolved","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"GLM 5.3 Flash","modelSlug":"z-ai-glm-5-3-flash","score":55.3,"rank":6,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/open-llm-leaderboard"},{"model":"GLM 5.2","modelSlug":"z-ai-glm-5-2","score":54.7,"rank":7,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/open-llm-leaderboard"},{"model":"Kimi K2.6","modelSlug":null,"score":54,"rank":8,"resolution":"unresolved","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"DeepSeek V4 Flash","modelSlug":"deepseek-v4-flash","score":51.6,"rank":9,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/open-llm-leaderboard"},{"model":"DeepSeek V4 Pro","modelSlug":"deepseek-v4-pro","score":48.2,"rank":10,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"GPT-5.6 Sol","modelSlug":null,"score":47.2,"rank":11,"resolution":"unresolved","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"Gemini 3 Pro","modelSlug":"gemini-3-pro","score":45.8,"rank":12,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"Kimi K2 Thinking","modelSlug":null,"score":44.9,"rank":13,"resolution":"unresolved","sourceUrl":"https://www.vellum.ai/open-llm-leaderboard"},{"model":"Gemini 3.1 Pro","modelSlug":"gemini-3-1-pro","score":44.4,"rank":14,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"GPT-5.5 Pro","modelSlug":"openai-gpt-5-5-pro","score":43.1,"rank":15,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"GPT-5.5","modelSlug":null,"score":41.4,"rank":16,"resolution":"unresolved","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"Gemini 3.5 Flash","modelSlug":null,"score":40.2,"rank":17,"resolution":"unresolved","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"Claude Opus 4.6","modelSlug":null,"score":40,"rank":18,"resolution":"unresolved","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"GPT-5","modelSlug":null,"score":35.2,"rank":19,"resolution":"unresolved","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"Kimi K2.5","modelSlug":null,"score":30.1,"rank":20,"resolution":"unresolved","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"Grok 4","modelSlug":"grok-4","score":25.4,"rank":21,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"gpt-oss-120b","modelSlug":null,"score":14.9,"rank":22,"resolution":"unresolved","sourceUrl":"https://www.vellum.ai/open-llm-leaderboard"},{"model":"gpt-oss-20b","modelSlug":null,"score":10.9,"rank":23,"resolution":"unresolved","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"R1","modelSlug":"deepseek-r1","score":8.6,"rank":24,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/open-llm-leaderboard"}],"sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"slug":"gpqa-diamond","name":"GPQA Diamond","category":"reasoning","description":"Published Best in Reasoning (GPQA Diamond) scores.","measures":"Published Best in Reasoning (GPQA Diamond) scores.","limitation":"Scores are benchmark-specific and missing values are not estimated.","source":"https://www.vellum.ai/llm-leaderboard","publishedAt":"2026-08-25","entries":[{"model":"Claude Sonnet 5","modelSlug":"claude-sonnet-5","score":96.2,"rank":1,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"Claude 3 Opus","modelSlug":"claude-3-opus","score":95.4,"rank":2,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"GPT-5.6 Sol","modelSlug":"openai-gpt-5-6-sol","score":94.6,"rank":3,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"Gemini 3.1 Pro","modelSlug":"gemini-3-1-pro","score":94.3,"rank":4,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"Claude Opus 4.7","modelSlug":"anthropic-claude-opus-4-7","score":94.2,"rank":5,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"Kimi K3","modelSlug":"moonshotai-kimi-k3","score":93.5,"rank":6,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/open-llm-leaderboard"},{"model":"MiniMax M3","modelSlug":"minimax-minimax-m3","score":93,"rank":7,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/open-llm-leaderboard"},{"model":"GLM 5.2","modelSlug":"z-ai-glm-5-2","score":91.2,"rank":8,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/open-llm-leaderboard"},{"model":"Kimi K2.6","modelSlug":"moonshotai-kimi-k2-6","score":90.5,"rank":9,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/open-llm-leaderboard"},{"model":"DeepSeek V4 Pro","modelSlug":"deepseek-v4-pro","score":90.1,"rank":10,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/open-llm-leaderboard"}],"sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"slug":"terminal-bench-2-1","name":"Terminal-Bench 2.1","category":"terminal","description":"Published Best in Terminal Use (Terminal-Bench 2.1) scores.","measures":"Published Best in Terminal Use (Terminal-Bench 2.1) scores.","limitation":"Scores are benchmark-specific and missing values are not estimated.","source":"https://www.vellum.ai/llm-leaderboard","publishedAt":"2026-08-25","entries":[{"model":"GPT-5.6 Sol","modelSlug":null,"score":88.8,"rank":1,"resolution":"unresolved","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"Kimi K3","modelSlug":"moonshotai-kimi-k3","score":88.3,"rank":2,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"Claude Mythos 5","modelSlug":"claude-mythos-5","score":88,"rank":3,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"Gemini 3.7 Flash","modelSlug":null,"score":85.8,"rank":4,"resolution":"unresolved","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"Claude Fable 5","modelSlug":"anthropic-claude-fable-5","score":84.3,"rank":5,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/llm-leaderboard"},{"model":"GLM 5.3 Flash","modelSlug":"z-ai-glm-5-3-flash","score":84.3,"rank":6,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/open-llm-leaderboard"},{"model":"GLM 5.2","modelSlug":"z-ai-glm-5-2","score":81,"rank":7,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/open-llm-leaderboard"},{"model":"MiniMax M3","modelSlug":"minimax-minimax-m3","score":66,"rank":8,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/open-llm-leaderboard"},{"model":"Kimi K2.5","modelSlug":"moonshotai-kimi-k2-5","score":50.8,"rank":9,"resolution":"canonical","sourceUrl":"https://www.vellum.ai/open-llm-leaderboard"},{"model":"Kimi K2 Thinking","modelSlug":null,"score":35.7,"rank":10,"resolution":"unresolved","sourceUrl":"https://www.vellum.ai/open-llm-leaderboard"}],"sourceUrl":"https://www.vellum.ai/llm-leaderboard"}]