From one piece The Evolving Landscape of LLM Evaluation 2 beliefs · ruder.io
-
Their words
GPT models perform much better on coding problems released before their pre-training data cut-off.
-
Their words
The time when benchmarks lasted multiple decades has passed. Going forward, we will rely less on public benchmark results.