Tech
[分享发现] 我觉得目前小模型的训练方向都跑偏了
小模型(<10B 的模型)都学着 qwen 去卷 agentic 了。但是编程的人,总会用更大的模型来达到高效率。
反而小模型应该深耕的语言方向,移动端对话方向,都荒废了。
测了近 10 个最新的小模型,只有 Gemma4 E4B 能做好我需求的特定模版下的翻译加分析句子任务。
一个个 benchmark 分数越来越高,却都忽略了最原本的语言能力。
Read the full discussion on V2EX
This article was aggregated from V2EX. Click to join the conversation.
View on V2EX