群发资讯网

字节跳动内部严禁蒸馏开源模型 这就是一次纯纯的商业考量。字节是一个全球化的公司,

字节跳动内部严禁蒸馏开源模型 这就是一次纯纯的商业考量。

字节是一个全球化的公司,它有这样的考虑,坦率来讲也很正常啊。

另外一个角度呢?

就是理论上字节应该已经是中文互联网最大的内容公司、科技公司,对吧?

这应该是没有问题的,他应该手握着中文互联网最大的语料库、数据库、知识库。

但是基于这些信息去训练的大模型,其实还是不够,因为中文互联网的数据库、语料库里面,其实充斥着大量的重复和无用信息。

这跟整个互联网的内容环境有关,那另外一个其实就是更底层的技术架构。

我觉得从技术架构上面来讲,其实这里面要拆分几个点:

1. 对于大模型本身的里面的算法结构。2. 第二个其实还是算力基础、训练基础。

其实字节已经是算力规模比较大的公司了。

我不知道它现在是第一还是第几,但是它的规模已经算很大了。

但是坦率来讲,早些年买的卡其实还是没有像海外这么新。数据的训练速度跟质量其实还是没有那么高。