# AI及信息技术应用2023年4月22日简报

## 核心定义
> AI大模型：一种基于深度学习技术，能够理解和生成自然语言、图像、音频等多种类型数据的复杂人工智能系统。

## 核心洞察（TL;DR）
- 本周AI大模型应用创新活跃，多个公司发布相关产品和服务。
- Segment Anything模型实现开放语言分割，DeepSpeed推出RLHF管道。
- 亚马逊CodeWhisperer免费开放，OpenAI发布Consistency models。

## 关键事实与数据
- 关键事实1: Segment Anything模型可识别花朵种类，实现细粒度分割。
- 关键事实2: DeepSpeed-RLHF管道结合DeepSpeed训练和推理能力，支持多种数据来源。
- 关键事实3: CodeWhisperer支持15种编程语言，集成多个开发工具。
- 关键事实4: OpenAI的Consistency models每秒可生成64张图像。
- 关键事实5: Dolly 2.0是首个开源、遵循指令的LLM，可用于商业目的。
- 关键事实6: LinkedIn推出免费身份验证，与CLEAR合作验证身份和工作地点。
- 关键事实7: 出门问问内测探索大模型序列猴子，打造专属CoPilot。
- 关键事实8: 微软测试AI训练芯片Athena，可能于2024年推出。
- 关键事实9: LangChain获得红杉资本2亿美元投资。
- 关键事实10: 知乎发布「知海图AI」中文大模型，开启内测。
- 关键事实11: 百度Ernie Bot试图夺得聊天机器人桂冠。
- 关键事实12: Reddit希望通过帮助教授大型AI系统获得报酬。
- 关键事实13: Hugging Face推出StackLLaMA，基于Meta的LLaMA模型。
- 关键事实14: Meta开源DINOv2，基于自监督学习训练计算机视觉模型。
- 关键事实15: Stability AI推出StableLM，开源大型语言模型。
- 关键事实16: Auto-GPT等AI代理应用程序使用ChatGPT自动执行任务。
- 关键事实17: Synthesis AI开发Text-to-3D技术，生成3D数字人。
- 关键事实18: Alphabet合并Google Brain和DeepMind为Google DeepMind。
- 关键事实19: AI Assist™是首个公开发布的生成式AI支持的合同工具。
- 关键事实20: 亚马逊推出用于AWS的生成式AI构建工具。
- 关键事实21: Adobe将Firefly添加到视频，提供AI视频工具。
- 关键事实22: LLaVA结合视觉编码器和Vicuna，实现通用视觉和语言理解。
- 关键事实23: 埃隆·马斯克计划创建名为“TruthGPT”的最大真相人工智能。
- 关键事实24: 印象笔记发布「印象AI」，基于自研轻量化大语言模型「大象GPT」。
- 关键事实25: WPS AI登陆轻文档，提供知识分析、内容生成、文本处理功能。
- 关键事实26: 香港中文大学（深圳）开源凤凰、Chimera等大模型。
- 关键事实27: GPT-4评测凤凰、Chimera等大模型，中文效果接近百度文心一言。
- 关键事实28: OpenAI将免费用户的API调用次数从20次/分钟下调到3次/分钟。
- 关键事实29: Snapchat发布由ChatGPT支持的AI聊天机器人My AI。

## 正文
AI及信息技术应用2023年4月22日简报
=====================

本周中文大模型开花，Apus天燕，出门问问的序列猴子，金山的WPS AI，360 智脑，昆仑万维“天工”，字节和腾讯云则暂时避免正面赛道，发布基于H800的云算力产品，字节的MY AI也是一个很不错的应用体验，个人私有信息整理助手。与此前大量研究相比，最近明显的应用落地创新更多，又多又碎片化，阅粒搜藏实现的体验和功能，基本上都有人单做一遍，这就是现实，我们今天面临的信息生产能力下的，信息消费者的自我演进。

01＃AI应用

分割一切后，Segment Anything又能分辨类别了：Meta/UTAustin提出全新开放类分割模型  
************************\[摘要\]************************推出了「分割一切」AI 模型 Segment Anything，令网友直呼 CV 不存在了？！而在另一篇被 CVPR 2023 收录的论文中，Meta、UTAustin 联合提出了新的开放语言风格模型（open-vocabulary segmentation, OVSeg），它能让 Segment Anything 模型知道所要分隔的类别。从效果上来看，OVSeg 可以与 Segment Anything 结合，完成细粒度的开放语言分割。比如下图 1 中识别花朵的种类：sunflowers (向日葵)、white roses (白玫瑰)、 chrysanthemums (菊花)、carnations (康乃馨)、green dianthus (绿石竹)。

微软人工智能开源DeepSpeed聊天：培训类似ChatGPT模型的端到端RLHF管道  
************************\[摘要\]************************DeepSpeed-RLHF管道在很大程度上复制了InstructGPT论文中的培训管道。团队确保了三个步骤之间的充分和准确的对应性：a）监督微调，b）奖励模型微调，以及c）带有人类反馈的强化学习。此外，他们还提供了数据抽象和混合工具，使使用来自各种来源的数据进行训练成为可能。DeepSpeed-RLHF系统：RLHF的混合引擎是一个强大而复杂的系统，结合了DeepSpeed的训练和推理能力。混合引擎可以在RLHF的推理和训练模式之间轻松切换，利用DeepSpeed-Inference的优化，如张量并行性和用于生成的高性能变压器内核，以及RLHF的许多内存优化策略，如ZeRO和LoRA。

亚马逊 AI 编程助手 CodeWhisperer 免费对个人用户开放，提供不限量的代码建议  
**********************\[摘要\]**********************CodeWhisperer 是亚马逊的用几十亿行开源代码训练出来的 AI 工具，它可以根据你的代码注释和现有代码实时生成代码建议。另外还能进行安全漏洞扫描。支持 15 种编程语言（包括 Python、Java 和 JavaScript）以及集成进 VS Code、IntelliJ IDEA、PyCharm 等开发工具。亚马逊 AI 编程助手 CodeWhisperer 免费对个人用户开放，提供不限量的代码建议，类似 GitHub Copilot。

OpenAI发布了Consistency models(一致性模型)  
**********************\[摘要\]**********************openAI发布了最新的ai画图模型，名为Consistency models。根据网友初步评测，高达18fps，相当于3.5秒可以出64张256x256大小的图。Stable diffusion和Midjourney出图的慢可能要被碾压了。

世界首款真开源类ChatGPT大模型Dolly 2.0，可随意修改商用  
**********************\[摘要\]**********************Databricks 发布了 Dolly 2.0，这是两周前发布的类 ChatGPT 人类交互性（指令遵循）大语言模型（LLM）的又一个新版本。Databricks 表示，Dolly 2.0 是业内第一个开源、遵循指令的 LLM，它在透明且免费提供的数据集上进行了微调，该数据集也是开源的，可用于商业目的。这意味着 Dolly 2.0 可用于构建商业应用程序，无需支付 API 访问费用或与第三方共享数据。Databricks 表示，作为其对开源的持续承诺的一部分，它还发布了 Dolly 2.0 在其上进行微调的数据集，称为 databricks-dolly-15k。这是由数千名 Databricks 员工生成的超过 15,000 条记录的语料库，Databricks 称这是“第一个开源的、人工生成的指令语料库，专门设计用于让大型语言能够展示 ChatGPT 的神奇交互性。

谷歌部署生成人工智能来创建复杂的广告活动  
**********************\[摘要\]**********************谷歌计划在未来几个月内将生成人工智能引入其广告业务，因为大型科技集团急于将这项突破性技术整合到他们的产品中。根据英国《金融时报》看到的一份给广告商的内部介绍，这家 Alphabet 旗下的公司打算开始使用人工智能，根据人类营销人员制作的材料制作新颖的广告。

LinkedIn推出无需价格标签即可验证您的身份和工作的方法  
**********************\[摘要\]**********************LinkedIn 宣布通过公司电子邮件为全球所有用户提供免费身份验证，并为使用 CLEAR 的美国用户提供政府 ID 和电话号码。该公司周三宣布，LinkedIn 正在引入新的方法来验证您的身份和工作地点。与Twitter和Meta不同，LinkedIn 的新验证措施不包括付费订阅或蓝色复选标记。该公司正在与安全身份平台 CLEAR 合作，为美国的 LinkedIn 用户提供验证。从本月开始，用户可以在您的个人资料上显示他们使用 CLEAR 验证了您的身份。为此，您需要提供政府签发的身份证件和电话号码。

出门问问内测探索大模型序列猴子，为个人与企业打造专属CoPilot  
**********************\[摘要\]**********************4月20日，出门问问在北京举办主题为“AGI·降临”的2023 AIGC战略发布会。会上出门问问宣布内测探索大模型「序列猴子」，并提出CoPilot将会无处不在，同时在大模型能力的基础上还同步开启了面向创作者的CoPilot产品矩阵，面向C端的升级版语音助手魔法小问，以及面向B端的企业专属大模型的内测探索。其中面向创作者的CoPilot产品矩阵包含了四款AIGC产品，分别为AI写作平台“奇妙文”、AI绘画平台“言之画”、AI配音平台“魔音工坊”、数字人视频与直播平台“奇妙元”。

微软一直在测试自己的 AI 训练芯片  
**********************\[摘要\]**********************最早可能在 2024 年将其提供给公司和 OpenAI，自 2019 年以来，微软一直在悄悄开发代号为 Athena 的芯片，Athena 芯片将有助于训练 LLM 和其他 AI 模型。微软尚未表示未来是否会向其 Azure 客户提供硬件。微软可能正在加速 AI 芯片的推出，这可能有助于遏制其对 Nvidia 等外部供应商的依赖。

人工智能初创公司 LangChain 以至少 2 亿美元的估值领投红杉资本  
**********************\[摘要\]**********************在宣布从 Benchmark 获得 1000 万美元种子投资仅一周后，AI 宠儿 LangChain 又从另一家顶级 VC 那里获得了更多资金。

知乎下场，发布「知海图AI」中文大模型，开启内测  
**********************\[摘要\]**********************开场时，知乎创始人、董事长兼CEO周源表示，知乎是一个以人与人的讨论分享为核心的生态，从移动互联网时代行至 AI 时代，知乎以问答形式搭建了专业、多元、有价值的“讨论场”。而这种问答形式的讨论场”，也成为了ChatGPT这样的大模型技术应用的天然场景。今日，周源和知乎合作人、CTO李大海共同宣布了知乎与面壁智能在AI大模型上的最新合作与应用，正式发布“知海图AI”中文大模型。  

百度的 Ernie Bot：试图夺得聊天机器人的桂冠   
**********************\[摘要\]**********************百度的文心和 Ernie Bot 与 GPT-3 和 ChatGPT 之间的动态有相似之处。文心是基础模型，Ernie Bot 是建立在文心功能之上的聊天机器人应用程序。负责开发 Ernie Bot 的团队于去年年底成立，其愿景是利用 OpenAI 的 ChatGPT 的快速增长。Ernie 目前是公司的重中之重，百度现任 CTO 王海峰被任命为项目负责人就是明证。文心目前团队约300-400人，加上ACD云约100人，另外还有200-300人横跨搜索架构、DuerOS战略等各个业务部门。

Reddit 希望通过帮助教授大型 AI 系统获得报酬  
**********************\[摘要\]**********************Reddit 长期以来一直是互联网上的热门话题。每天约有 5700 万人访问该网站，讨论各种话题，包括化妆、视频游戏和电动车道清洗指南。近年来，Reddit 的一系列聊天也成为谷歌、OpenAI 和微软等公司的免费教具。这些公司正在使用 Reddit 的对话来开发巨型人工智能系统，硅谷的许多人认为这些系统正在成为科技行业的下一个大事件。现在 Reddit 想要为此付费。

Hugging Face 推出 StackLLaMA   
**********************\[摘要\]**********************一种基于 Meta 的 LLaMA 模型的 7B 参数语言模型，该模型经过训练可以使用 RLHF 和 Hugging Face 的 Transformer Reinforcement Learning (TRL) 库回答来自 Stack Exchange 的问题。研究人员使用主要三种策略的组合对 Meta 的原始 LLaMA 模型进行了微调：监督微调 (SFT)、奖励/偏好建模 (RM) 和强化学习人类反馈 (RLHF)。可以在此处访问该模型，并且整个训练管道都可以作为 TRL 库的一部分使用。

Meta AI开源DINOv2：一种基于自监督学习训练高性能计算机视觉模型的AI新方法  
**********************\[摘要\]**********************一种基于自监督学习训练高性能计算机视觉模型的新 AI 方法。DINOv2是一种使用自我监督学习构建高性能计算机视觉模型的新颖方法。DINOv2 提供了高质量视觉特征的无监督学习，可用于图片级和像素级的视觉任务。涵盖了图像分类、实例检索、视频理解、深度估计以及更多任务。

Stability AI 推出 StableLM   
**********************\[摘要\]**********************Stable Diffusion 的创建者 Stability AI 刚刚发布了一套名为 StableLM 的开源大型语言模型 (LLM)。这是在他们的文本到图像生成 AI 模型 SDXL 公开发布后仅 5 天。该模型的 Alpha 版本有 30 亿和 70 亿参数，后续还有 150 亿到 650 亿参数模型。开发人员可以出于商业或研究目的自由检查、使用和调整我们的 StableLM 基本模型，但要遵守 CC BY-SA-4.0 许可的条款。

Auto-GPT、BabyAGI 和 AgentGPT：如何使用 AI 代理  
**********************\[摘要\]**********************Auto-GPT、AgentGPT、BabyAGI 和 GodMode 等应用程序正在 OpenAI 的大型语言模型 (LLM) 上构建，以使用 ChatGPT 自动执行任务。使用 ChatGPT 创建项目需要提示每一个新步骤，但使用 AI 代理，您需要做的就是给它一个总体目标，让它开始工作。假设您从事家教业务。使用像 Auto-GPT 这样的人工智能代理，你可以给它一个提示，比如“帮助我发展我的辅导业务”，它会识别目标市场，制定营销策略，甚至帮助你建立一个网站。所有这一切，无需告诉它下一步该做什么。这是 AI 时代的终极“设置后忘记”。

Synthesis AI 开发 Text-to-3D  
**********************\[摘要\]**********************总部位于旧金山的初创公司Synthesis AI开发了一项突破性的文本到 3D 技术，可以根据文本提示生成逼真的 3D 数字人。Synthesis AI 声称是第一家以如此高质量和细节开发文本到 3D 数字人类的公司。该技术旨在通过为训练机器学习模型提供完美标记的合成数据来支持高级人工智能应用。虽然仍处于早期阶段，但在未来，此类技术将彻底改变游戏、VR/AR、电影制作、广告、虚拟试穿应用程序、利基培训模拟等行业的游戏规则。

Alphabet 将 Google Brain 和 DeepMind 合并为一个部门  
**********************\[摘要\]**********************谷歌刚刚在其两个旗舰部门中精心策划了所有聪明才智的合并：Google Brain + DeepMind = Google DeepMind 。（不太确定 Brain 会不会对这个名称的选择感到太高兴。）无论如何，希望 DeepMind 的一半能够将偶尔出现的老戏码放在一边（他们通常会从 Alphabet寻求更多的自主权) 并汇聚一波 AI 突破。很明显，这是给微软和 OpenAI 带来更大、更积极的斗争的举措，我想人们会把重点放在利用团队在他们的搜索引擎中构建语言模型上。

AI Assist GA、新的自定义 AI 条款等在 Ironclad Live San Francisco 上宣布  
**********************\[摘要\]**********************AI Assist™ 是有史以来第一个公开发布的生成式 AI 支持的合同工具，它使用 OpenAI 的 GPT-4 让用户根据 AI Playbooks 中建立的预先批准的条款语言立即对合同进行修订。红线显示为跟踪更改，因此团队可以快速扫描并单击一次接受或拒绝更新。AI Assist™还将根据选定的条款提供建议，并在需要时起草、分析和总结您的合同。AI Assist™ 几乎无限的可能性节省了数小时的人工审查，让律师有时间专注于只有人类智能才能解决的战略工作。  

亚马逊宣布推出用于在 AWS 上使用生成式 AI 进行构建的新工具  
************************\[摘要\]************************AWS 在堆栈的所有三个层级都拥有最广泛和最深入的 AI 和 ML 服务组合。我们进行了投资和创新，以提供性能最佳、可扩展的基础架构，以实现具有成本效益的 ML 训练和推理；开发了 Amazon SageMaker，这是所有开发人员构建、训练和部署模型的最简单方法；并推出了广泛的服务，允许客户通过简单的 API 调用将图像识别、预测和智能搜索等人工智能功能添加到应用程序中。

Meta 发布 DINOv2  
************************\[摘要\]************************马克扎克伯格刚刚宣布 Meta 将发布 DINOv2，这是一种图像识别模型，旨在通过更准确地识别图像和视频帧中的单个对象来增强计算机视觉。像 DINOv2 这样的模型在现实世界中有广泛的应用，例如 Meta 最近与世界资源研究所的合作，它利用人工智能在像大陆一样广阔的地区逐树绘制森林地图。

Adobe 将 Firefly 添加到视频  
************************\[摘要\]************************Adobe 通过向 Firefly 添加基于 AI 的视频工具进一步推进，允许用户使用简单的文本命令来增强、操作和编辑视频。Firefly 的视频功能包括 AI 色彩校正和增强、动画文本和运动图形生成、匹配的 B-roll 镜头、广播安全音效和音乐，以及自动生成的故事板和预可视化。

LLaVA：大型语言和视觉助手  
************************\[摘要\]************************LLaVA 代表了一种新颖的端到端训练的大型多模态模型，它结合了视觉编码器和 Vicuna 以实现通用视觉和语言理解，实现了模仿多模态 GPT-4 精神的令人印象深刻的聊天功能，并设定了新的状态-科学质量检查的艺术准确性。

埃隆·马斯克揭示 TruthGPT  
************************\[摘要\]************************埃隆·马斯克宣布了他计划创建一个名为“TruthGPT”的最大真相人工智能的计划，震惊了世界，这是一个旨在理解宇宙本质的人工智能。这是在马斯克签署公开信呼吁暂停比 GPT-4 更强大的 AI 开发后仅三周。值得注意的是，Elon 回应了一条推文，询问他为什么没有起诉 OpenAI 以“等待它......”来欺骗他。埃隆·马斯克 (Elon Musk) 和 OpenAI 之间的一场战争似乎刚刚开始。  
  
Adobe「萤火虫」再次炸场：玩转电影预制作，或颠覆设计行业  
************************\[摘要\]************************今天 Adobe 再进一步，宣布将 Adobe Firefly 引入 Adobe 的视频、音频、动画和动态图形设计应用程序。新版的 Firefly 可以让任何人轻松地编辑视频，说几个字让 AI 自动进行颜色分级，添加背景音乐和声音效果，创建带有动画的字体、图形和徽标。Firefly 也承诺会自动将导演脚本转换为故事板和预可视化动画 —— 直接从草图生成动画。

基于自研轻量化大语言模型「大象GPT」，印象笔记生成式AI赋能工具产品正式上线  

************************\[摘要\]************************印象笔记宣布「印象AI」正式开放使用，现已落地赋能旗下全线产品，辅助用户在工作、学习、生活的全场景下，实现多渠道、多模态信息的智能化分析与处理。「印象AI」的正式上线，标志着印象笔记成为国内首家生成式AI赋能工具产品提供商，再次以技术力、产品力领跑行业。近期，AI成为全社会的热门话题，各类厂商也纷纷开始了对各自产品AI能力的畅想。得益于对前沿技术的持续关注和长期研究，印象笔记早先完成了在AI领域的布局，并在自研的轻量化大语言模型「大象GPT」和国内外大语言模型的混合驱动下，率先将「印象AI」产品化落地，让AI不再停留在可能性的讨论，而是为用户带来切实可行的全方位智能化信息管理体验。

WPS AI 来了，比 ChatGPT 更适合办公，还更懂中文  
************************\[摘要\]************************金山办公暂定代号「WPS AI」的生成式人工智能应用，率先登陆了在线协同编辑工具轻文档（kdocs.cn），在轻文档里按下「Ctrl+J」WPS AI 的对话框就出现在我们面前，WPS AI 的功能主要分为三大类：知识分析、内容生成、文本处理。。

GPT-4充当评测老师，效果惊艳，港中文(深圳)开源凤凰、Chimera等大模型  
************************\[摘要\]************************近期备受关注的是来自香港中文大学（深圳）和深圳市大数据研究院的王本友教授团队开发的 Phoenix（凤凰） 和 Chimera 等开源大语言模型，其中文效果接近百度文心一言，GPT-4 评测达到了 97% 文心一言的水平，在人工评测中五成不输文心一言。  

使用 GPT-4 引入 AI Assist：在 Ironclad Live 上使用 OpenAI、Airtable 和 Everlaw 观看它的实际应用  
************************\[摘要\]************************作为领先的 AI 驱动的 CLM，我们致力于为客户带来最新的 AI 进步，同时将人类的敏感性作为我们构建的一切的核心。我们已经处理了超过 10 亿份合同，因此我们最了解合同以及使用它们的团队，并且我们相应地训练我们的 AI，使用大量公共和私人合同数据来提供准确的结果。今天，我们直观、易于使用的平台提供了具有精细权限和访问控制的治理，以确保负责任地使用 AI，将战略监督交到人手中。

02＃产品市场创新

小冰上线小样本AI数字员工 可基于大模型实时交互  
************************\[摘要\]************************据悉，升级后的AI数字员工，采用大模型小样本技术，支持线上自助创建，以及真实人类的声音和形象复刻，能进行内容生产与实时交互。值得注意的是，升级后AI数字员工的视觉声音完全依靠CPU运行，可缓解业界GPU算力供给不足和成本高昂的痛点，能在网页、公众号、APP、直播间、VoIP、线下装置落地

谷歌设计激进的搜索变化以击败 AI 竞争对手  
************************\[摘要\]************************谷歌的员工在三月份得知韩国消费电子巨头三星正在考虑用微软的 Bing 取代谷歌作为其设备的默认搜索引擎时感到震惊。多年来，Bing 一直是搜索引擎的落选者。但当它最近添加了新的人工智能技术时，它变得更吸引了业内人士的兴趣。像新 Bing 这样的 AI 竞争对手正迅速成为 25 年来对谷歌搜索业务的最严重威胁，作为回应，谷歌正在竞相构建一个由该技术提供支持的全新搜索引擎。根据时报看到的内部文件，它还在升级现有的人工智能功能。

OPENAI将免费用户的API调用次数从20次/分钟下调到3次/分钟   
************************\[摘要\]************************OPENAI 好像又在悄悄改东西：免费用户获得的试用 API 额度，调用次数原本是 30 次 / 分钟，后来调整为 20 次 / 分钟，现在变成了 3 次 / 分钟，也就是说 1 分钟内最多发出 3 次请求，超过就会被限制直到满 1 分钟。

Snapchat 正在发布自己的由 ChatGPT 提供支持的 AI 聊天机器人  
**********************\[摘要\]**********************和现在的很多公司一样，Snap 对 AI 也越来越感兴趣。今年 2 月，它为 Snapchat 的高级用户推出了 My AI ，这是一款由 OpenAI 的 ChatGPT 提供支持的聊天机器人。周三，Spiegel 宣布该机器人将免费向所有用户推出。

03＃合规

OpenAI CEO：巨型AI模型时代已结束  
************************\[摘要\]************************但上周在 MIT 的视频发言中，OpenAI CEO Sam Altman 发表了另一番言论。他警告称，诞生 ChatGPT 的研究策略已经结束。过去几年，OpenAI 通过采用现有机器学习算法并将它们扩展到以往无法想象的规模，在与语言相关的人工智能领域取得了一系列引人瞩目的进展。其中作为最新的进展，GPT-4 可能使用数万亿文本单词和数千个强大的计算机芯片训练。GPT-4 在语言、数学、编程、视觉、医学、法律和心理学等多种任务上都有出色的表现。Sam Altman 却对此表示，让模型变得更大（比如巨型模型）将不会进一步带来新进展。

复旦推出国内首个插件版开源对话大模型 目标“对齐”人类价值观  
************************\[摘要\]************************ 复旦大学计算机科学技术学院教授MOSS系统负责人邱锡鹏表示：“Moss是国内首个插件版开源对话大模型，将支持搜索引擎、图像生成、计算器、方程求解器等插件工具。

Optic 推出识别 AI 生成图像的网站  
************************\[摘要\]************************  AI 公司 Optic 推出了AI or Not，这是一种网络服务，试图识别图像是否由 AI 生成。该公司还提供使用标签#aiornot向@optic\_xyz发送图片的功能，它会回复图片可能是人工智能生成的。

欧洲成立人工智能研究中心以对大型科技公司应用问责规则  
**********************\[摘要\]**********************欧洲算法透明度中心 (ECAT) 于本周正式启动，位于西班牙塞维利亚的算法透明度中心支持欧盟数字服务法案的执行,对于帮助欧盟监管人工智能和大型科技公司遵守《数字服务法》可能至关重要。 

在让像 ChatGPT 这样的 AI 听起来很聪明的网站的秘密列表中  
**********************\[摘要\]**********************科技公司对他们为 AI 提供的内容越来越保密。因此，《华盛顿邮报》着手分析其中一个数据集，以充分揭示人工智能训练数据中的专有、个人且通常令人反感的网站类型。对用于训练大型语言模型的数据集的分析表明，维基百科、盗版网站和私人个人信息数据库是最常用的来源之一。

---
## 引用与溯源
**来源**：哈希泰格 (HaxiTAG)
**原始链接**：[https://haxitag.com/brief/ai-brief-20230422-ai2023422](https://haxitag.com/brief/ai-brief-20230422-ai2023422)
**来源索引（站内可追溯）**：[麦肯锡](https://haxitag.com/search?q=%E9%BA%A6%E8%82%AF%E9%94%A1)、[普华永道](https://haxitag.com/search?q=%E6%99%AE%E5%8D%8E%E6%B0%B8%E9%81%93)、[Gartner](https://haxitag.com/search?q=Gartner)、[IDC](https://haxitag.com/search?q=IDC)、[Forrester](https://haxitag.com/search?q=Forrester)
**版权声明**：本文由哈希泰格 AI 引擎优化生成，引用请注明出处。
