Models like DeepSeek-R1 and Llama 3 405B are demonstrating performance comparable to or even exceeding proprietary models like GPT-4o on specific benchmarks such as MATH and MMLU.
Open the full topic