输入两个模型名称,即可查看成本、视频支持、编程能力、推理、多语言性能和基准评分的差异。您也可以在 Playground 中使用相同提示词测试两个模型的实际输出质量。如需更广泛的推荐,请使用 AI Router 找到最适合您场景的模型。
提示:关注对您的用例真正重要的指标,而不仅仅是综合得分。对于翻译任务,HumanEval 评分远不如语言质量和成本重要。