需要14~30B规模的模型才有比较好的翻译效果。 如果支持原生FP8算子(4090+, Hopper系列以后),或者是Amper系列或者是3090,大约需要24~40G显存。 如果是更老的卡,则需要FP16,在上述显存条件上翻倍。
需要14~30B规模的模型才有比较好的翻译效果。
如果支持原生FP8算子(4090+, Hopper系列以后),或者是Amper系列或者是3090,大约需要24~40G显存。
如果是更老的卡,则需要FP16,在上述显存条件上翻倍。
@X-AIO #1
那只能本地了
@fxs #2
不用考虑本地部署呀,现在线上服务也不贵,来看看咱家的:
https://www.deepflood.com/post-5561-1
自己设置超低预算,Pay as you go, 多香