在与他人讨论AI的用途时,最常得到的回答之一便是将文件上传使用。无论是50页的PDF,还是一张电子表格,亦或是一份杂乱的文档,通过ChatGPT、Claude或Gemini等工具几秒钟就能获取总结或答案。这种便利确实让人难以抵挡,我自己也常常这样做。然而,潜在问题在于,我们往往无意中将云端大模型视为个人电脑的私人文件存储,但实际上并非如此。有些文件上传可能无妨,但有几类文件绝对应远离消费级云端大模型。
需明白的是,上传文件与直接在本地打开是截然不同的过程。当将文件传给ChatGPT、Claude或Gemini等云端AI工具时,文件必须离开您的设备,并在他人的服务器上进行处理。依据服务提供商、账号种类及设置的不同,这些数据可能会被存留一段时间,甚至用于改进服务。这并不意味着这些公司会随意将您的文档分享给陌生人,或者每个上传的文件都会被用于训练模型。问题在于,一旦上传,您便把原本仅限于个人设备上的信息托付给他人。
有些人或许会认为,上传后删除文件就没事。但实际上,删除并不总意味着数据会立即从服务器中消失。根据不同的服务,副本可能因为安全性、防滥用或法律原因而被保留一段时间。对于普通的PDF或者您本就愿意公开的文档,这类取舍或许并不需要过多担忧。然而,只要文件中包含丝毫敏感信息,上传前不妨再三思考。
密码、密钥与凭证,这些信息绝不可轻易放入聊天框中。大家或许会觉得,不会无缘无故把密码发给ChatGPT。确实,大多数人不会在聊天框中输入邮箱或社交网络中的密码,询问是否足够安全。然而,凭证这类信息很容易潜藏在您随意上传的文件之中。例如,.env文件中可能包含API密钥、数据库凭证和访问令牌,或者是项目运作所需的秘密设置。配置文件、代码片段、日志、导出的设定,都可能含有这些信息。此外,入职邮件、安装指南及内部文档中也可能蕴含临时密码、账号找回链接和访问码。您可能只是想让云端机器人帮忙调试代码错误,却不小心把凭证一并上传了。
在财务类文件方面,特别需要小心的是这类文档。银行流水、纳税申报表、工资单、信用报告及投资对账单,包含的敏感信息远超您初见时的印象。举例来说,一份银行流水不仅显示账户余额,还可能暴露您的全名、地址、账户信息、消费习惯、周期性付款及工资信息,甚至您习惯光顾的商家和服务。此外,税务文件更是将财务信息与身份识别信息混在同一文件中。
至于政府签发的证件,几乎应该立即排除在上传名单之外。护照扫描、驾照、身份证、出生证明及签证申请等文档,都可能包含大量个人信息。例如,护照上涵盖的内容有:法定全名、出生日期、国籍、护照号、照片以及签名等身份识别细节。而签证申请文件往往信息更为详尽,有时还包含居住地址、旅行记录、就业信息、财务状况及联系方式。这些信息与随意处理的普通文档截然不同,很多都是与您身份紧密相关。如果您的目的仅是请大模型解释某一特定字段或翻译一段文本,根本无需上传完整的未处理文件。
至于医疗记录,更是不能随意交给聊天机器人。目前,有些人习惯通过询问ChatGPT来获得症状信息,这是可以理解的,因为其速度更快且形式更接近对话。然而,这种操作很容易升级为上传化验报告、处方、出院记录、影像报告甚至基因检测结果,这些文件包含着极为敏感的信息,包括诊断、用药、检查结果和病史等隐私内容。仅仅因为想搞清楚报告中的一行信息,将整个文件上传至云端聊天框,实在没有必要。
除此以外,工作相关的机密文件处理时亦需谨慎。内部文件、会议记录、客户资料和草拟合同等内容,往往不仅属于个人。上传这些文件前,值得先考量其是否包含他人信息,以及公司是否希望这些内容保持隐秘。云端大模型无疑便捷,但这并不意味着所有文件都应上传。在上传之前,最好花几秒钟评估文件内容,这将比事后想方设法进行补救更为轻松。