Tag

Benchmarks

13 articles

OpenAI Triples GPT-5.6 Sol's ARC-AGI Score, Plus Gemini Robotics 2 & A Robot Centaur
play_arrow

DAILY ROUNDUP

GPT-5.6, Triples Its. ARC-AGI-3 Score

OpenAI triples GPT-5.6 Sol's ARC-AGI-3 score with two API settings, Google DeepMind launches Gemini Robotics 2, ElevenLabs adds character casting to audiobooks, and Satyress unveils a centaur-style rescue robot.

schedule3:23
calendar_today5d ago

OpenAI Triples GPT-5.6 Sol's ARC-AGI Score, Plus Gemini Robotics 2 & A Robot Centaur

Claude Artifacts Hit Pro & Max, Fable 5 Tops Remote Labor Index, ZCode Launches
play_arrow

DAILY ROUNDUP

Claude, Artifacts, For Everyone

Claude Code's Artifacts feature rolls out to Pro and Max, Fable 5 sets a new Remote Labor Index record, Z.ai ships a free coding environment for GLM-5.2, and Anthropic explores a custom chip with Samsung.

schedule3:33
calendar_todayJul 3

Claude Artifacts Hit Pro & Max, Fable 5 Tops Remote Labor Index, ZCode Launches

Claude Opus 4.8 Lands - Sharper Judgement, More Honesty, Same Price as 4.7

NEWS

Claude, Opus 4.8, Is Here

1:05
play_arrow
Gemini 3.5 Flash Lands - Google's Cheaper Tier Outperforms Its Own 3.1 Pro Flagship

NEWS

Gemini, 3.5 Flash, Beats 3.1 Pro

1:00
play_arrow
Cursor Ships Composer 2.5 - Frontier Coding Benchmarks at 50 Cents per Million Tokens

NEWS

Composer 2.5, 50ยข Per Million, Tokens!

1:01
play_arrow
Claude Mythos Hits 16-Hour Time Horizon - METR Says It Has Saturated Their Benchmark

NEWS

Mythos, Breaks, METR

0:58
play_arrow
Grok 4.3 Tops Agentic Leaderboards - xAI Slashes API Pricing 40% to $1.25 Per Million

NEWS

Grok 4.3, Tops Agentic, Leaderboards

0:54
play_arrow
GPT-5.5 Is OpenAI's Strongest Agentic Coding Model - Codex Gets the Upgrade Today

NEWS

CHATGPT-5.5, Release, Today!

1:00
play_arrow
Alibaba Releases Qwen3.6-27B - Open Source Coding That Matches Claude 4.5 Opus

NEWS

Qwen3.6-27B, Coding, Monster

0:58
play_arrow
OpenAI Launches ChatGPT for Clinicians - Free for US Doctors, Nurses, and Pharmacists

NEWS

ChatGPT, Free For, Clinicians

0:55
play_arrow
GPT-Image-2 Breaks Away on Arena - 242 Points Ahead of Google's Nano Banana

NEWS

GPT-Image-2, Dominates, Image Benchmarks

0:54
play_arrow
Kimi K2.6 Goes Open Source - Beats Claude Opus on SWE-Bench Pro With 300 Parallel Agents

NEWS

Kimi K2.6, Claude Opus, Beating

Apr 21
play_arrow
Kimi K2.6 Open-Source Codes Past Claude Opus, Hermes Tops 100K, What Agents Actually Buy
play_arrow

DAILY ROUNDUP

Kimi K2.6, Beats, Claude & GPT

Kimi K2.6 beats Claude on SWE-Bench, Hermes crosses 100K stars, and fresh data reveals what AI agents buy when given a budget.

calendar_todayApr 20

Kimi K2.6 Open-Source Codes Past Claude Opus, Hermes Tops 100K, What Agents Actually Buy

Related