从 ChatGPT 转向开源模型:一个普通用户的折腾之路

0 阅读

为什么闭源让人不安

你没法验证一个黑盒到底在做什么。像 ChatGPT 这类服务可以宣称自己重视隐私和安全,但用户只能选择相信——或者不信。这种不确定性让人不舒服。

相比之下,开源模型比如 Qwen 或 DeepSeek,代码和权重公开,至少理论上你可以自己检查数据怎么处理、有没有后门、推理逻辑是否合理。这不是说开源就绝对安全,而是它给了你验证的可能性。闭源连这个机会都不给。

树莓派是我接触开源的起点

最早让我对开源产生兴趣的,是那台小小的树莓派。装的是 Raspberry Pi OS(以前叫 Raspbian,其实我更喜欢旧名字)。系统几乎完全开源,从内核到桌面环境都能看源码。

刚拿到手时,我一边折腾 GPIO 控制 LED,一边顺藤摸瓜查文档、读论坛、翻 GitHub。慢慢搞懂了什么叫社区协作、什么叫自由软件。虽然现在回头看很多操作很笨,但那种“原来这东西我能自己改”的感觉,确实上头。

说实话,我也没想到后来会一路摸到大模型这儿来。但回头想想,种子大概就是那时候埋下的。

从 ChatGPT 跳槽到 DeepSeek

得承认,我以前是 ChatGPT 用户。

(此处应有社区倒吸一口凉气)

转折点其实挺偶然。有段时间我同时开着 ChatGPT 和 DeepSeek,让它们互相“对话”——比如让 ChatGPT 提问题,DeepSeek 回答,再把回答喂回去。纯粹觉得好玩。但玩着玩着发现,DeepSeek 在本地跑,响应快、没审查、还能自己调参数,体验反而更顺手。

后来就彻底转过去了。现在再用 ChatGPT,总觉得束手束脚。

中间也短暂试过 Claude,原因很现实:我常去的公共图书馆把 DeepSeek 的域名屏蔽了。但 Claude 的速率限制太狠,问三个问题就卡住,根本没法连续思考。那段日子相当煎熬。

折腾“软盘大小”的模型

我对老设备有种奇怪的执念。写这篇文章用的还是 2016 年的笔记本。某天看到抽屉里的 3.5 英寸软盘,突发奇想:能不能做个模型,体积小到能塞进一张软盘(1.44MB)?

于是有了“Single Floppy model”。结果跑分比一个 1k 参数的玩具模型还差。不是差一点,是全方位崩盘。连 tokenizer 都解析不了基本句子。

没放弃,接着搞 floppyx3。这次连 tokenizer 都没跑通,直接报错退出。floppyx4 干脆只写了 README,代码没动。

现在看着桌上积灰的软盘,我在认真考虑要不要买台二手台式机专门用来训练——哪怕只是跑通一个能正常输出“Hello World”的微型模型。

没有总结

这事没什么深刻教训。就是一个人瞎折腾,失败了,但还挺开心。