大模型LLM的历史时间线

(AI时间线生成)

大语言模型(Large Language Model,LLM)是基于海量数据和深度学习技术构建的自然语言处理模型,具备理解和生成人类语言的能力,是人工智能领域最具代表性的技术方向之一,深刻推动了对话系统、内容创作、代码生成等应用的变革。

2017年6月

Google团队在论文《Attention Is All You Need》中提出Transformer架构,摒弃传统循环神经网络,引入自注意力机制,为大模型发展奠定了核心基础架构。这一创新解决了长距离依赖问题,并支持高效的并行训练,成为后续所有大语言模型的标准组件。

2018年6月

OpenAI发布GPT-1(Generative Pre-trained Transformer)模型,首次将大规模预训练与下游任务微调相结合,采用无监督预训练加有监督微调的范式。GPT-1拥有1.17亿参数,在当时多个自然语言处理基准上取得了显著进展,开启了预训练语言模型的新时代。

2018年10月

Google发布BERT(Bidirectional Encoder Representations from Transformers),通过双向Transformer编码器实现深层上下文理解,参数规模达3.4亿。BERT在SQuAD等11项自然语言处理任务上刷新纪录,成为NLP领域里程碑式的模型,并推动预训练模型进入工业应用阶段。

2019年2月

OpenAI推出GPT-2模型,参数规模增至15亿,采用更大的数据和模型量训练。GPT-2展现出惊人的文本生成能力,可以连贯通顺地生成连贯段落,但当时出于安全担忧未完全开源。这一模型证明了扩大参数规模可以显著提升模型的语言理解和生成能力。

2020年5月

OpenAI发布GPT-3,参数量达到1750亿,训练数据量达45TB。GPT-3展示了强大的少样本/零样本学习能力,无需微调即可通过提示词完成翻译、问答、写作等任务。其惊人的通用性引发了全社会对大语言模型潜力的广泛讨论,被视为LLM发展史上的重要转折点。

2022年11月30日

OpenAI正式上线对话式AI产品ChatGPT,基于GPT-3.5架构优化,采用人类反馈强化学习(RLHF)技术进行对齐。ChatGPT凭借流畅自然的对话能力和广泛的应用场景迅速破圈,上线5天用户数突破100万,两个月月活用户达1亿,成为历史上增长最快的消费级应用,引爆了全球AI热潮。

2023年3月14日

OpenAI发布GPT-4,这是一个大规模多模态模型,能够接收图像和文本输入并生成文本输出。GPT-4在各种专业和学术基准上表现出接近人类的水平,如通过律师资格考试、SAT数学满分等。其强大的推理能力和多模态理解能力标志着大模型能力再上新的台阶。

2023年3月

Meta发布LLaMA开源模型系列,包括70亿至650亿参数多个版本。LLaMA仅用公开数据集训练即展现出与GPT-3相当的性能,仅需较小算力即可运行。这一系列模型的开源极大地推动了全球学术研究和中小企业对LLM的探索,促进了社区生态的蓬勃发展。

2023年7月

国内多家企业推出自主训练的大模型,包括百度的文心一言、阿里巴巴的通义千问、商汤的日日新等,其中部分模型开源。这一年中国大模型进入爆发期,数百个模型相继发布,覆盖语言、视觉、多模态等多种能力,加速了LLM在中文场景的落地应用,形成多元开放的技术格局。

2024年2月

OpenAI推出视频生成模型Sora,虽然并非直接的大语言模型,但其底层采用Transformer架构和扩散技术,能够生成高质量长视频,引发对大模型视频理解与生成能力的热议,也展示了Transformer在其他模态扩展的可能性,进一步拓展了大模型的应用边界。

更多历史时间线