印度一吹牛就坏事了!
事情要从DeepSeek V4-Flash说起。2026年7月31日,DeepSeek发布了V4-Flash版本,总参数284B的MoE架构,单次推理只激活13B参数,每百万Token输入只要1块钱、输出2块钱。
海外开发者实测,GPT-5.6 Sol耗时107秒的任务,V4-Flash只用40秒就完成了。又快又便宜质量还高,发布之后全球又是一波“DeepSeek时刻”的狂欢。
就在这个节骨眼上,印度媒体吹嘘过的“比DeepSeek还牛”的大模型重新进入了大家的视线。
印度初创公司Sarvam AI在2026年2月发布了Sarvam-105B旗舰模型,总共105B参数。
印度顶级财经媒体Moneycontrol报道说,这个模型在关键基准测试中的表现优于DeepSeek-R1和Gemini Flash。Sarvam AI的联合创始人、首席科学家Pratyush Kumar博士公开表示:“总参数只有105B,但在绝大多数推理基准上,击败了600B总参数的DeepSeek-R1。”这话说得相当硬气。
不止Sarvam一家。另一家印度公司169PI推出了320亿参数的Alpie模型,号称在GSM8K数学榜单上超过了DeepSeek V3。一时间印度媒体炒作“亚洲AI三足鼎立”,仿佛印度已经跟中美平起平坐了。
然而技术圈的人不吃这一套。有AI玩家不服气,直接动手拆解了这些模型的权重和底层代码。扒开底裤一看,真相让人哭笑不得。
Sarvam-105B的架构与DeepSeek在2024年公开的MLA多头隐注意力、MoE专家路由、GRPO强化学习等全套方案完全一致。
Sarvam-105B完整复用了这套技术栈,只是缩小了参数量、调整了专家容量,配置文件结构高度近似。这个“105B”说白了就是个DeepSeek的山寨缩水版。
更直接的案例是Alpie。开发者拆解后发现,Alpie的底层架构脱胎于DeepSeek-R1-Distill-Qwen-32B开源模型。本质上就是在中国的开源基座上面做了二次蒸馏、微调和量化优化。
开发文档自己都承认了——Alpie-Core被描述为“基于DeepSeek-R1-Distill-Qwen-32B主干构建”。技术圈直接调侃:“这不就是DeepSeek的印度分Seek?”
所谓“2000万美元训练成本”的宣传水分也很大。基础底座是开源免费的,成本只花在了本土数据微调环节,根本不是完整自研的全链路训练。
印度这些模型有一个共同特点——在本土语言场景下确实能跑出不错的分数,但一旦脱离印度语加持,逻辑推理、多轮对话、长文本理解能力就大幅下滑。
拿一个在印度语上训练出来的模型去跟DeepSeek比推理基准,这本身就很滑稽。谁花那么多时间去学印地语这种小语种?
更值得玩味的是这背后的政府补贴逻辑。印度政府正在大力推动“主权AI”,提供了4096块H100的算力补贴,换取Sarvam的股权。国家战略驱动之下,企业有动力“抢跑”发布,哪怕技术根基不牢。
一边是政府出钱扶持从零训练底层模型,另一边企业依托成熟开源底座蒸馏微调、换上本土名称就当作自研成果高调发布。
中国大模型不仅养活了全球开发者,还养活了不少套壳忽悠本国政府补贴的软件公司。这话虽然刻薄,但放在印度这些公司身上似乎并不过分。
DeepSeek选择开源,本意是推动全球AI技术进步。结果倒好,有人拿着开源的底座搞开发,搞出来不仅不认账,还处处宣称“超越”了你。这就像抄了一套完整的教材,重新培养了个学生出来,然后到处说这个学生比原作者还厉害。
不过话说回来,Sarvam AI好歹是完整从头预训练出来的,不是直接复制粘贴。架构虽然抄了DeepSeek,但人家确实花了算力和时间重新训练了一遍。这跟那些连代码版权标记都懒得删的韩国团队比起来,还算是有点底线。
但无论如何,“自研”两个字是站不住脚的。架构照搬、方案照抄,只是缩小了参数量、调整了专家容量,这算什么自主研发?拿政府的补贴、用开源的底座、换一个本土化的名字,然后高调宣称“超越DeepSeek”——这套路放眼全球都不新鲜,只是印度这次做得太明显、吹得太过分,被技术圈当场拆穿。
DeepSeek V4-Flash的发布就像一面照妖镜。中国模型越做越好、越做越便宜,那些靠套壳和营销话术撑起来的“自研”神话,也就越来越藏不住。印度想在AI领域实现“主权”,这个想法本身没有错。
但靠吹牛、靠套壳、靠忽悠政府补贴,这条路走不远。真正的技术自主,从来不是靠蒸馏和微调就能弯道超车的。


