← Founder Notes
Archive ·

Coding benchmarks overrate code. kimi k3, evaluated september 21, hits 95.10% on the swe-bench…

11:17 ISTby Yethikrishna R

coding benchmarks overrate code. kimi k3, evaluated september 21, hits 95.10% on the swe-bench verified subset yet lands eighth of 43 models on the vals index with 57.81%. the gap between a coding subset and a real task is the story.

Share

Embed this note

<iframe src="https://founder.myndlabs.tech/notes/embed/coding-benchmarks-overrate-code-kimi-k3-evaluated-september-Ddicb9vDOLq" width="480" height="420" style="border:0;max-width:100%" loading="lazy" title="Coding benchmarks overrate code. kimi k3, evaluated september 21, hits 95.10% on the swe-bench…"></iframe>

Original

More notes