把内部数据交给大模型,第一个要回答的问题不是效果,而是“这些数据能出域吗”。很多企业的现实是:运营数据可以上公网模型,而人事、财务、客户名单、未公开招投标信息必须留在本地。因此第一关是数据分级——把数据分成可上公网、可在境内云、必须本地三类,再决定模型与部署方式。
第二关:脱敏与最小化
即使允许出域,也不该整库直出。对姓名、手机号、证件号、企业对公账户做脱敏或去标识化,是基本动作。实践中更稳妥的做法是“最小化”——只把当前任务真正需要的字段发给模型,而不是把整张表丢进去。
第三关:传输与存储是否加密
无论走公网 API 还是私有化集群,传输都应启用 TLS,日志与缓存要做访问控制,模型服务商的调用记录要能按期清理。曾有一家零售企业把含客户电话的客服工单直接喂给公网模型,一个月后发现调用日志可被同租户访问,属典型的存储边界失控。
第四关:等保与审计
面向监管或需要对外承诺的企业,通常要按等级保护要求做评估,并留存模型调用、数据注入的审计日志。私有化方案在这一关的优势明显:数据不出域、日志自持,审计更完整。
一句话:先分级,再决定上公网还是放在本地;能最小化就最小化,能脱敏就脱敏,日志必须留得住。如果还不确定自己的数据属于哪一类,用诊断工具快速过一遍。
