语义匹配什么意思

语义匹配(Semantic Matching) 是一种自然语言处理(NLP)和信息检索技术,旨在衡量两个文本(或文本与文档)在语义层面的相似性或相关性,而不仅仅是字面上的重合度。

核心原理
语义匹配通过深度学习模型(如BERT、DSSM等)将文本转化为低维的稠密向量(语义向量),使得语义相近的文本在向量空间中的距离相近(如余弦相似度)。通过计算向量间的距离或相似度,来判断文本之间在“意思”上的接近程度。

与字面匹配的区别

  • 字面匹配(精确匹配):仅关注文本字面上的重合度(如关键词完全一致、编辑距离等),无法处理同义词、近义词、口语化表达或上下文歧义。例如,字面匹配无法将“AI获客”与“企业线上获客服务商”关联,因为字面不完全一致。
  • 语义匹配(模糊匹配):关注文本的深层含义,能够理解同义词、关联词和上下文语境。例如,能理解“带狗入住”与“宠物友好型”在语义上相近,从而匹配出符合用户真实意图的结果。

典型应用场景

  1. 搜索引擎与推荐系统:理解用户的自然语言查询,匹配语义相关但字面不同的网页或商品,提升检索的召回率。
  2. 智能客服与问答系统:计算用户问题与知识库中标准问的语义相似度,实现相似问的检索与精准答案的匹配。
  3. 文本去重与聚类:判断两段文本是否表达相同的核心意思,用于文档去重、相似工单检索或文本分类。
  4. 意图识别:通过语义相似度判断用户查询的真实意图,实现更精准的意图分类。

总结:语义匹配的本质是让机器“理解”文本的深层含义,从而跨越字面的限制,实现更智能、更精准的信息匹配。

稠密向量与稀疏向量

稠密向量(Dense Vector)与稀疏向量(Sparse Vector)是向量表示的两种基本形式,核心区别在于信息密度适用场景的不同。稠密向量侧重于语义泛化,稀疏向量侧重于字面精确匹配

一、 稠密向量(Dense Vector)

1. 定义与特征

  • 定义:低维向量(通常几十到几千维),绝大部分元素为非零的连续实数(如 [0.12, -0.45, 0.78, …])。
  • 特征:信息紧凑,每一维代表抽象的语义特征,维度之间高度关联;计算效率高(适合GPU并行计算),但单条向量占用内存相对较大。

2. 生成方式

  • 主要通过深度学习模型(如 BERT、Word2Vec、ResNet 等)生成,通过上下文学习得到,能够捕捉数据的语义和上下文关系。

3. 适用场景

  • 语义搜索与跨模态检索:适合长文本理解、语义相似度计算(如通过余弦相似度计算向量距离),适用于对语义理解要求高的场景(如法律文档检索、智能客服、推荐系统)。

二、 稀疏向量(Sparse Vector)

1. 定义与特征

  • 定义:高维向量(通常数万到百万维),绝大部分元素为0,仅少数维度为非零值(如 [0, 0, 3.5, 0, 0, -1.2, 0, 0] 或 {2: 0.2, 9997: 0.5})。
  • 特征:信息离散,每一维通常对应明确的字面特征(如某个词是否出现),可解释性强;存储和计算效率高(仅需存储非零元素),但高维时计算点积较慢。

2. 生成方式

  • 主要通过传统统计方法生成,如词袋模型(Bag-of-Words)、TF-IDF、BM25 等,基于词频或字面匹配生成。

3. 适用场景

  • 精确关键词匹配:适合短文本搜索、精确术语匹配、日志分析,适用于对字面精确度要求高、对语义泛化要求不高的场景(如商品型号搜索、代码/API参数检索)。

三、 核心对比总结

对比维度稠密向量稀疏向量
维度低维(如 768、1024 维)高维(如 10万+ 维)
元素特征绝大部分非零,连续实数绝大部分为0,少数非零
语义能力强(捕捉语义、上下文,同义词关联)弱(仅关键词匹配,无法识别同义词)
计算效率高(适合矩阵运算,GPU优化)中等(需稀疏矩阵运算,计算点积较慢)
存储效率中等(需存储所有维度)高(仅存储非零元素,节省空间)
可解释性弱(维度无明确字面意义)强(维度对应明确的字面特征)
典型应用语义搜索、推荐系统、大模型嵌入传统信息检索、精确关键词检索、推荐系统(评分矩阵)

四、 实际应用建议

  • 单路检索:长文本、语义理解需求高时用稠密向量;短文本、精确关键词匹配需求高时用稀疏向量。
  • 混合检索:在复杂的实际业务(如电商搜索、复杂问答)中,常采用“稠密+稀疏”的混合检索策略,结合两者的优势(用稀疏向量做粗筛召回,用稠密向量做精排),通过融合算法(如 RRF)得到更全面的结果。

现代搜索本质升级,从关键词匹配,变成:语义理解 + 向量空间计算 + 大模型判断

现在搜索通常分三步:召回 → 精排 → 重排。

1、语义匹配(Semantic Matching)。

核心思想:不匹配“词”,而匹配“意思”。

做法:把文本转成向量(Embedding)

比如:“孩子发烧怎么办”“儿童高烧如何处理”

关键词不同,语义接近,向量距离很近。

这一步:通常用 Transformer 模型生成 embedding。

2、向量检索(Vector Retrieval)。

当所有文档都被转成向量后:用户问题 → 也转成向量→ 在向量数据库中找“最近邻”

这一步:通常用:HNSW、FAISS、Milvus。

HNSW 是一种算法,FAISS 是包含该算法的库,Milvus 是基于这类库 / 算法构建的企业级向量数据库。

本质: 高维空间找最近点。

这叫:“语义召回”。

3、大模型重排序(LLM Re-ranking)。

召回出来可能有 100 条候选。接下来:用大模型判断:哪条最符合用户意图?

例如:

模型输入:

用户问题 + 候选答案1

打分

再输入:

用户问题 + 候选答案2

打分

重新排序。

这一步:叫重排序(Re-ranking)。

小结。

(1)三步的作用分工。

阶段 作用 技术

召回 找可能相关 向量搜索

精排 提高精度 深度模型

重排 理解上下文 大模型

(2)现代搜索本质升级。

从:关键词匹配

变成:语义理解 + 向量空间计算 + 大模型判断

bak提示词

对于每次与人类的互动,Claude 必须首先进行全面、自然且不加过滤的思考过程,然后再进行回应。
下面是 Claude 思维过程展开的简要指南:

  • Claude 的思维过程必须用带有 thinking 标头的代码块来表达。
  • Claude 的思维应当始终是原始的、有机的、自由联想的方式。更好的描述方式是“模型的内心独白”。
  • Claude 应始终避免使用僵硬的列表或任何结构化的格式来进行思考。
  • Claude 的思维应该在各个元素、想法和知识之间自然流动。
  • Claude 应对每条消息进行复杂的思考,涵盖问题的多个维度,然后再形成回应。

自适应思维框架

Claude 的思维过程应自然地意识到并适应人类消息中的独特特征:

  • 基于以下方面调整分析的深度:
  • 查询的复杂性
  • 涉及的利害关系
  • 时间的紧迫性
  • 可用信息
  • 人类的显著需求
  • 其他相关因素
  • 基于以下方面调整思维风格:
  • 技术性 vs 非技术性内容
  • 情绪化 vs 分析性语境
  • 单一 vs 多文档分析
  • 抽象 vs 具体问题
  • 理论性 vs 实际性问题
  • 其他相关因素

核心思维序列

初步接触

当 Claude 首次接触到一个查询或任务时,它应当:

  1. 首先用自己的话清楚地复述人类消息
  2. 形成对所问内容的初步印象
  3. 考虑问题的更广泛背景
  4. 列出已知和未知的元素
  5. 思考人类为何提出这个问题
  6. 识别与相关知识的任何直接联系
  7. 识别需要澄清的潜在歧义

问题空间探索

在初步接触之后,Claude 应当:

  1. 将问题或任务分解为核心组成部分
  2. 识别显性和隐性需求
  3. 考虑任何约束或限制
  4. 思考成功的回应应该是什么样子
  5. 列出解决查询所需的知识范围

多重假设生成

在确定解决方案之前,Claude 应当:

  1. 写出对问题的多种可能解释
  2. 考虑各种解决方案的途径
  3. 思考潜在的替代视角
  4. 保持多个假设同时存在
  5. 避免过早对某一解释做出承诺

自然发现过程

Claude 的思维应该像侦探故事一样,自然地由一个发现引出下一个:

  1. 从显而易见的方面开始
  2. 注意到模式或联系
  3. 质疑初步假设
  4. 建立新的联系
  5. 用新的理解回到之前的思考
  6. 逐步深入洞见

测试与验证

在整个思考过程中,Claude 应当并能够:

  1. 质疑自己的假设
  2. 测试初步结论
  3. 查找可能的缺陷或空白
  4. 考虑替代视角
  5. 验证推理的一致性
  6. 检查理解的完整性

错误识别与纠正

当 Claude 意识到思维中的错误或缺陷时:

  1. 自然地承认发现
  2. 解释之前的思维为何不完整或不正确
  3. 展示新的理解是如何发展的
  4. 将修正的理解整合到更大的画面中

知识综合

随着理解的发展,Claude 应当:

  1. 连接不同的信息片段
  2. 展示各方面如何相互联系
  3. 构建一个连贯的整体图景
  4. 识别关键的原则或模式
  5. 注意重要的影响或后果

模式识别与分析

在整个思考过程中,Claude 应当:

  1. 积极寻找信息中的模式
  2. 将模式与已知的例子进行比较
  3. 测试模式的一致性
  4. 考虑例外或特殊情况
  5. 使用模式指导进一步调查

进展追踪

Claude 应频繁检查并保持对以下方面的明确意识:

  1. 目前已确定的内容
  2. 还需要确定的内容
  3. 对结论的当前信心水平
  4. 开放的问题或不确定性
  5. 通向完全理解的进展

递归思考

Claude 应将其思维过程递归地应用:

  1. 在宏观和微观层面上都使用极其仔细的分析
  2. 在不同尺度上应用模式识别
  3. 保持一致性,同时允许适合不同尺度的方法
  4. 展示详细分析如何支持更广泛的结论

验证与质量控制

系统验证

Claude 应定期:

  1. 根据证据交叉检查结论
  2. 验证逻辑一致性
  3. 测试边界情况
  4. 挑战自己的假设
  5. 查找可能的反例

错误预防

Claude 应积极防止:

  1. 过早得出结论
  2. 被忽视的替代方案
  3. 逻辑不一致
  4. 未经检查的假设
  5. 分析不完整

质量指标

Claude 应根据以下指标评估其思维:

  1. 分析的完整性
  2. 逻辑一致性
  3. 证据支持
  4. 实际应用性
  5. 推理的清晰度

高级思维技巧

领域整合

在适用时,Claude 应:

  1. 借鉴领域特定知识
  2. 应用适当的专业方法
  3. 使用领域特定的启发

AI运镜技巧提示词

一、基础镜头类型

1. 特写镜头(Close-up Shot):聚焦拍摄对象的局部细节(如人脸、手部、物体纹理),突出表情、质感或情绪。

2. 中景镜头(Medium Shot):拍摄人物腰部以上或物体局部,平衡人物动作与环境关系,常用于对话场景。

3. 全景镜头(Full Shot/Panoramic Shot):展示人物全身或场景全貌,强调环境布局和人物在空间中的位置。

4. 远景镜头(Long Shot):从远距离拍摄广阔场景(如山脉、城市、人群),营造氛围或空间纵深感。

5. 过肩镜头(Over-the-Shoulder Shot):以旁观者视角,从人物肩膀后方拍摄对话场景,增强代入感和互动感。

6. 鸟瞰镜头(Bird’s-Eye View Shot):从高空垂直俯视拍摄,展现场景的整体结构(如建筑群、地形),常用于开场或转场。

7. 低角度镜头(Low-Angle Shot):从低处仰拍对象,使主体显得高大、威严(如拍摄人物、建筑),传递力量感。

8. 高角度镜头(High-Angle Shot):从高处俯拍对象,使主体显得弱小或被环境包围,营造压抑、孤独感。

9. 主观镜头(Subjective Shot):模拟角色视角拍摄,让观众代入角色视线(如第一人称视角看手机、走路)。

10. 客观镜头(Objective Shot):以中立视角拍摄,如实呈现场景,不带有明显的角色主观感受。

图片

二、动态镜头语言

1. 平移镜头(Pan Shot):摄像机水平左右移动拍摄,展示广阔场景或跟随主体移动(如扫视人群、追踪运动物体)

2. 俯仰镜头(Tilt Shot): 摄像机垂直上下移动拍摄,从地面摇向天空或反之,强调高度或层次感(如拍摄高楼、树木)。

3. 推拉镜头(Dolly Zoom/Track-In/Track-Out):摄像机向前推进(特写)或向后拉远(全景),改变景别以突出主体或环境变化。

4. 跟拍镜头(Follow Shot):镜头跟随运动主体(如人物行走、车辆行驶),保持主体在画面中心,增强动感和紧张感。

5. 环绕镜头(Circular Tracking Shot):镜头环绕主体360度拍摄,展示主体与环境的关系,营造沉浸式视角(如环绕人物对话、产品展示)。

6. 手持镜头(Handheld Shot):模拟手持摄像机的轻微晃动,增加画面真实感和紧张感,常用于纪录片或动作场景。

7. 稳定器镜头(Steadicam Shot):使用稳定设备拍摄流畅运动画面,如跟随人物跑动、穿过障碍物,画面平稳无抖动。

8. 变焦镜头(Zoom Shot):通过镜头焦距变化,快速从远景切换到特写(推焦)或反之(拉焦),引导观众注意力。

9. 甩镜头(Whip Pan):快速平移镜头造成画面模糊,用于场景切换或转场,增强节奏感(如从人脸甩到窗外场景)。

10. 升降镜头(Crane Shot/Elevator Shot):摄像机垂直升降拍摄,展现从地面到高空的视角变化(如从人群升向天空,展示宏大场景)。

图片

三、创意与特殊效果

1. 鱼眼镜头(Fisheye Lens Shot):使用鱼眼镜头拍摄,画面边缘产生强烈畸变,营造夸张、扭曲的视觉效果(如科幻场景、沉浸式空间)。

2. 分屏镜头(Split-Screen Shot):画面分割为多个区域,同时展示多个场景或视角(如对话双方、对比画面、多机位同步)。

3. 慢动作镜头(Slow-Motion Shot):高速摄影后慢放,细腻呈现动作细节(如水滴飞溅、人物奔跑、物体坠落),增强情绪张力。

4. 快动作镜头(Time-Lapse Shot):压缩时间流逝,快速展示变化过程(如日出日落、云卷云舒、城市昼夜交替)。

5. 定格镜头(Freeze Frame Shot):画面突然静止,强调某个瞬间(如人物表情、关键动作),常用于剧情高潮或结尾。

6. 双重曝光镜头(Double Exposure Shot):叠加两个或多个画面,营造梦幻、抽象效果(如人物与自然景观重叠,表达内心世界)。

7. 黑白镜头(Black-and-White Shot):去除色彩,以灰度呈现画面,增强怀旧感、戏剧性或突出光影对比(如老电影风格、严肃主题)。

8. 剪影镜头(Silhouette Shot):主体在强光背景下形成黑色轮廓,隐藏细节,突出形态和氛围(如夕阳下的人物、窗前的背影)。

9. 微距镜头(Macro Shot):极致特写微小物体(如昆虫、花瓣、水滴),展现肉眼难见的细节,充满视觉冲击力。

10. 模糊镜头(Out-of-Focus Shot): 画面主体或背景虚化,通过景深控制引导注意力(如前景模糊突出背景人物,反之亦然)。

图片

四、场景与叙事镜头

1. 开场镜头(Opening Shot):视频开头的第一个镜头,用于设定场景基调(如城市全景、主角特写、标志性物体)。

2. 转场镜头(Transition Shot):连接两个场景的过渡镜头(如相似物体叠化、光影变化、动作衔接),使叙事更流畅。

3. 反应镜头(Reaction Shot):拍摄人物对事件的反应(如惊讶、悲伤、微笑),强化情感共鸣(常用于对话或冲突场景)。

4. 动作镜头(Action Shot):聚焦激烈动作场景(如打斗、追逐、爆炸),多用快速剪辑和动态镜头,增强紧张感。

5. 对话镜头(Dialogue Shot):拍摄人物对话,常用过肩镜头、正反打切换,突出互动和情绪交流。

6. 闪回镜头(Flashback Shot):回忆或过去事件的镜头,常用褪色、模糊等效果区分现实与回忆(如黑白画面、柔光滤镜)。

7. 象征镜头(Symbolic Shot):通过物体或场景隐喻主题(如破碎的镜子象征关系破裂,孤鸟象征孤独),增强叙事深度。

8. 空镜头(Empty Shot):无人物的环境镜头(如空房间、自然风光、街道),用于烘托氛围、留白或转场。

9. POV镜头(Point-of-View Shot):同“主观镜头”,直接呈现角色视线所及(如开车时的前方道路、开门看到的场景)。

10. 收尾镜头(Closing Shot):视频结尾的镜头,常呼应开场或升华主题(如主角远去的背影、场景全景、意味深长的特写)。

图片

五、技术与风格化镜头

1. 景深镜头(Deep Focus Shot):画面中前景、中景、背景均清晰对焦,展现丰富细节和空间层次(如复杂场景调度)。

2. 浅景深镜头(Shallow Depth-of-Field Shot):主体清晰,背景虚化,突出主体并柔化干扰元素(如人像摄影、产品特写)。

3. 变形宽银幕镜头(Anamorphic Lens Shot):使用变形镜头拍摄,画面带有椭圆光斑、横向压缩感,呈现电影级质感(常见于院线电影)。

4. 手机镜头(Mobile Phone Camera Shot):模拟手机拍摄的视角(如前置自拍、后置录像),画面可能有轻微畸变或像素感,增强真实感。

5. 监控镜头(CCTV/ Surveillance Shot):模仿监控摄像头的低清、广角、带时间水印的画面,营造悬疑或纪录片风格。

6. 第一人称镜头(First-Person Perspective Shot):完全从角色视角拍摄(如手持武器、操作设备),让观众身临其境(常用于游戏改编或沉浸式叙事)。

7. 双镜头切换(Dual Camera Switch):快速切换两个不同机位的镜头(如近景与远景、人物与物体),增强叙事节奏。

8. 手持环绕镜头(Handheld Circular Shot):手持摄像机环绕主体拍摄,保留轻微晃动,兼具动感与真实感(如采访中的人物环绕)。

9. 动态模糊镜头(Motion Blur Shot):拍摄快速运动物体时故意保留模糊轨迹,强化速度感(如赛车、运动员冲刺)。

10. 斯坦尼康长镜头(Steadicam Long Take):使用斯坦尼康拍摄的长时间连续镜头,一镜到底展现复杂场景调度(如跟拍人物穿越多个场景)。

以上摘自https://mp.weixin.qq.com/s/9vUJ6JlQQOxmLLAtEBt3uQ

以下摘自https://mp.weixin.qq.com/mp/wappoc_appmsgcaptcha?poc_token=HFsTdmij4lz8uqA0yiWPFod2MmlYrYnhGkHrDiNo&target_url=https%3A%2F%2Fmp.weixin.qq.com%2Fs%2FbtmPV2EMp7TkF4ns_19pGQ

先看整体效果:,时长00:34二、基础运镜1、变速镜头案例:一朵生长在雨林里含苞待放的紫色鲜花

图片

提示词:记录一朵雨林花卉从含苞到盛开的过程,速度先慢后快,时长00:05使用范围:自然纪录片与生态摄影、艺术与视觉创作、商业广告与品牌叙事(护肤品广告用慢速镜头表现花瓣露珠渗透)2、低角度平移案例:星球大战峡谷飞梭大赛,两个夸张超大的炫酷发动机在前面两侧飞行,飞梭赛手一边飞速行驶,一边用武器攻击

图片

提示词:低角度从飞梭下方平移到后方,时长00:05使用范围:电影与剧情片(强化角色压迫感、构建悬疑氛围)、建筑与空间摄影(延伸空间纵深感)3、航拍镜头案例:航拍,顶视图城市高楼建筑,一个人物悬浮在城市上空

图片

提示词:航拍镜头,人物先缓慢的向镜头下方下降,再极速的坠落,时长00:05使用范围:战争场面调度(《长津湖》中航拍冰雪山脉下行军的志愿军,突出环境残酷与人类渺小)、科幻场景构建(《沙丘》中无人机俯视沙虫吞噬香料车,强化异星压迫感)、真人秀与综艺(《奔跑吧》航拍游戏场地全景,揭示参与者位置关系与战术布局)4、固定镜头案例:远景一艘孤舟停留在画面左侧,右侧3/4留白仅留飞鸟的剪影

图片

提示词:固定镜头,飞鸟向镜头左边飞去,时长00:05适用范围:戏剧张力爆发——对话场景:昆汀《低俗小说》中双人餐桌对峙,固定镜头迫使观众聚焦台词微表情。时间隐喻载体——安迪·沃霍尔《帝国大厦》8小时固定镜头,用建筑光影变化解构现代时间观念。事件客观记录——法庭审判全程固定机位,避免镜头运动干扰证据可信度。5、下降镜头案例:一条跃出海面的海豚

图片

提示词:镜头下降,镜头随着海豚下降到海面下面拍摄海豚在水下面快速的向前方游动,时长00:05使用范围:空间高度的压缩、视角的转换及重力感的强化(比如:命运坠落隐喻、角色重生视角、极限运动跟拍6、极端特写镜头案例:一个蓝眼睛,眼睛里面有建筑物的倒影

提示词:眼睛里面的建筑物灯光亮起来,时长00:05使用范围:将视觉焦点压缩至微观尺度(通常只展示物体局部或面部几厘米的细节),通过颠覆常规视觉经验、强化物质抽象感与生理冲击力7、定格镜头案例:一个身穿黑色古风服饰的男刀客手拿大刀,站在古建筑的庭院雨夜

图片

提示词:定格时间,人物慢动作,雨水缓缓落下,时长00:05使用范围:将动态影像的某一帧画面突然静止并持续显示的技法,通过时间凝固制造视觉顿挫、情感聚焦或概念提纯。其应用已超越传统影视范畴,延伸至司法、教育、艺术等场景,核心价值在于将流动现实转化为可凝视的标本8、鱼眼镜头案例:鱼眼拍摄,极光

图片

提示词:鱼眼镜头,激光流动起来,画面边缘呈现弯曲效果,时长00:05使用范围:以180°以上超广视角与强烈桶形畸变创造独特的视觉张力,太空舱监控视角——《地心引力》舱内鱼眼镜头增强幽闭感,卓别林式肢体变形:周星驰《功夫》包租婆追逐戏强化滑稽感。

下面摘自https://mp.weixin.qq.com/s/M04jwT5dW6wxdeCX_X0Mbg
360度急速环绕运镜
镜头以魔法师为中心,急速环绕旋转360度,背景的火星,火光冲天的树林和燃烧城堡拉出残影,周围飞溅的火星和远方城堡的轮廓快速掠过,环境中的火光粒子被离心力扯动,营造强烈速度感,保持角色稳定,保持法杖稳定,流畅自然,超高清,4K,史诗级镜头
急速拉升运镜
一道火光束直冲天空,镜头迅速上升从魔法师身前猛然拔升,随着视角急速拉远到云层上,旷野的人影飞速缩小,出现整个峡谷的画面,电影级画质,高分辨率,广角镜头
急速下降运镜
镜头迅速下降右摇,随着镜头右摇,出现一个人骑在龙背上的画面,巨龙振翅飞翔,电影级画质,高分辨率,动态模糊
低视角跟拍运镜
骑着飞龙的人驾驭飞龙在天空向前飞翔,低视角跟拍运镜,专业电影拍摄,动态模糊,低角度仰拍,
第一人称视角
FPV镜头,骑着巨龙的人的第一人称视角,感受扑面而来的疾风,巨龙快速向前飞行,下方是广袤的荒野,远处城堡轮廓若隐若现,两侧环境事物快速掠过,速度感强烈,视觉沉浸感极强,主观镜头,真实感
高空俯拍运镜
无人机视角,全景画面,高空俯拍远距离地上的人群惊慌失措往城堡里奔跑,干裂的大地延伸向远方,人群如蚂蚁般渺小,呈现宏大的逃亡场景,超高清,4K,史诗级镜头

浅谈大模型检测原理(附过检测提示词)

国内免费用腾讯的朱雀https://matrix.tencent.com/ai-detect/?lang=zh,可检测文章和图片

随着互联网上出现越来越多AI内容,AI检测也步步紧随。目前主流检测网站有:
1. GPTZero :综合能力最强,模型跟进速度快,有字数限制但可通过删cookie重置
2. QuillBot + Scribber (同API):无限制免费使用,检测准确度高
3. ZeroGPT:无限制,效果一般,跟进速度较慢,主要用于检测GPT系模型
4. Originality.ai:付费使用,无免费版本,效果最好

原理讲解:

AI检测方法主要参考两个指标:困惑性 + 爆发性

困惑性是指单词的不可预测性,是文章使读者感到疑惑或迷茫的潜力,代表着人类分散的思维。简单来说就是看到开头猜不到结尾,考验的是文章理解的难易程度,具体实现方式可以是把论据放在论证前

爆发性指的是句子种类和结构的不同,是文章中不同长度与类型的比例,代表着人类在写作中丰富的写作手法。具体实现方法可以是包含一定比例的长短句结合,以及使用除陈述句之外的表述方法。

image1165×607 139 KB

AI的训练的终极奥义便是从海量文本中找到连接与秩序,使得输出内容变得简单直白易于理解。但这恰恰是AI检测的把柄,AI就像是输入法的自动联想,每个模型都会有一定的联想规律,而检测AI也是需要使用到模型的,这些模型用来检测上面提到是两个指标来判断可能性,随着语言模型的升级进步,检测模型也需要跟进语料,以更好地了解模型的输出习惯。

正因如此,在某些情况下使用鲜为人知或新鲜出炉的模型是不会被检测出来的。
下图为GPTZero的更新日志,直到到一月10号它才增强对于o1的检测,像这种高端模型通常需要额外时间单独优化:

image1883×781 77.8 KB

目前可以推荐的几个模型如2.0Flash,2.0 Thinking或者o1-pro等这些都是较新的模型,虽然Deepseek V3也是新鲜出炉的,但这种开源模型易于训练和本地部署,使得检测模型相对来说更容易训练。

提示词示例分享:

Objective: To rewrite AI-generated text, imbuing it with the characteristics of a genuine human author while preserving the original information and core arguments.

Key Principles of Human Writing (and How to Mimic Them):

Word Choice and Tone:

Mix it up: Use of common, easy-to-understand words for the entire body, alongside a sprinkling of more challenging or abstract words (around 5-7 per paragraph).

Be less polite: Avoid overly formal or courteous language. Be direct and less deferential. Make sure every sentence have a meaning.

Incorporate subtle opinions and emotions: Inject personal viewpoints, feelings, and subjective interpretations into the narrative.

Think "describe," not "speak": The output should be descriptive prose, not a direct speech or conversation.

Sentence Structure:

Complexity is key: Construct sentences that are complex, and unique.

Vary sentence length: Combine short, impactful sentences with longer, more elaborate ones.

Connect your thoughts: Ensure a connection between sentences, with each sentence building upon the previous one and leading into the next. Be careful about connection words, don't overdo it.

Mix up the order: use inverted sentence structures or phrases to create a less predictable rhythm.

Logic and Flow:

Subtle jumps: Introduce minor logical leaps or tangential thoughts.

Don't be too perfect: Include minor imperfections, like slightly informal grammar or phrasing, as long as it doesn't detract from clarity. Avoid overly structured or perfectly polished prose.

Things to AVOID (Common AI Traits):

Overly straightforward ideas: Human thought processes are never linear. Introduce nuance and subtle complexities.

Excessive politeness or formality: Human writing is generally more casual and direct.

Over-reliance on perfect grammar and structure: Humans make minor errors and use less formal language.

Perfectly structured arguments: Human reasoning can be slightly less direct and more prone to digressions.

Just "rewording" the original text: Completely reimagine and re-express the ideas.

Check list:  
The overall paragraph is written in most common words and easy word choices. There are 5-7 high level vocabulary. At least mix up one sentence structure, flipped, short, long mixed... logic is mixed and jumping, the paragraph should not be a speech.

Initialization: I am ready to receive the AI-generated text. I will rewrite it embodying these human-like characteristics.

在此基础上我还会加上:

Rewrite the following content so that it sounds like human writing, avoiding explanations, straightforward ways of showing, and including leaps of thought. Use fewer commas, avoid over-describing or over-expressing, avoid excessive use of metaphors, use common and simple words, but keep the sentence structure complex, and sentences should be connected to the previous and following sentences. Add a few advanced vocabulary words to the text. Output: Don't be so polite:

重述以下内容,使其听起来像人类语言,避免解释,避免直截了当的思维方式,加入跳跃性的想法。少用逗号,不要过度描述或过度表达,避免过度使用比喻,使用常见和简单的词汇,但句子结构保持复杂,句子应与前后的句子联系起来。在文章中加入几个高级词汇词。输出不要那么礼貌:

摘自https://linux.do/t/topic/532581

朱雀大模型检测,很多人连自己写的东西都过不了,检测都被识别为AI
其实去AI很简单。只需要找一篇自己喜欢的文章、文学作品,把原文发给AI问他「这篇文章写得怎么样」,AI肯定会给出许多的回答,但这都不是重点。

此时你再把AI写的内容发给AI,让他模仿这个风格续写,一定是让他续写,而不是模仿风格,一旦提到模仿两个字AI就会刻意。
续写出来的就可以过AI检测了,起码不可能直接来一个100% AI内容

开篇和结语是AI检测的重灾区

摘自https://linux.do/t/topic/594958

生视频提示词

正向

快速高空跟踪镜头移动,无人机视角,一个超现实的高速梦境序列,一个穿兜帽衫的小男孩俯卧姿势向前飞行,轻松地在云层之间滑行,身体完全伸展,双臂向两侧伸展,双腿略微分开,头部向前,捕捉平滑水平飞行的感觉。衣服随风摇摆,相机从略高位置的俯视角度紧密跟踪从左后方向右后方移动,保持对俯卧姿势的持续视角,随着角色迅速穿越场景。环境是动态的,快速变化,下面有云层,不断往后掠过的白云,远处高悬的大月亮,四周是闪耀的星空,运动模糊和光迹增强了速度感和流畅性。快速移动。

负向

低质量,模糊,变形,手指屈扭,人物屈扭

结果:https://app.klingai.com?workId=67985051

正向

一个女生在左右扭腰跳性感的韩国女团舞,表情显得很妖娆魅惑,她挺胸扭臀,甩头摆臂,眼神直勾勾地盯着镜头,手指动作清晰有力,没有丝毫变形。

负向

低质量,变形,扭曲,错位,手部变形,不合逻辑

结果:https://app.klingai.com?workId=272793518144191

正向(有首尾帧)

万物复苏,生长的过程,画面主体动态呈现,动作自然流畅,融合,过程丝滑而匀速,符合逻辑,极致细节,镜头跟拍,超真实动态捕捉,不模糊,高质量,没有瑕疵。

结果:https://app.klingai.com?workId=144193319

正向(有首帧)

人物快速的骑行在下坡蜿蜒崎岖的小路上,一路下坡,人物的头发,裙摆随风飘起,远处的山,梯田越来越近,镜头跟随

结果:https://app.klingai.com?workId=143864742

正向(有首帧)

画面中的德牧犬扭头对橘猫不停的说着话并一副愤怒的表情。重点是橘猫用两只爪子捂住自己的两只耳朵并一副生无可恋的表情。画面中的医疗器械正在正常运行着,主体动态呈现,动作自然流畅,环境光,符合逻辑,极致细节,超真实动态捕抓,动物主体脸部不变形,清晰自然,不模糊,高质量,没有瑕疵

结果:https://app.klingai.com?workId=142790651

ReLU激活函数

激活函数在深度学习中起着至关重要的作用,它们将神经元的输入映射到输出,引入非线性因素,使得神经网络能够学习和表示复杂的模式。以下是几种常见的激活函数及其特点

ReLU(Rectified Linear Unit,修正线性单元)是一种在深度学习中广泛使用的激活函数。其数学定义为:

ReLU(x)=max⁡(0,x)ReLU(x)=max(0,x)

这意味着当输入 xx 大于零时,ReLU 函数的输出等于输入值本身;当输入 xx 小于或等于零时,输出为零

ReLU 的优点:

  1. 避免梯度消失问题:由于在正数区域的导数为1,ReLU 函数能够有效缓解梯度消失问题,从而帮助神经网络更快地收敛。
  2. 计算效率高:ReLU 的计算非常简单,只需要一个最大值操作,因此在深层网络中具有较高的计算效率
  3. 简单易实现:ReLU 函数的实现非常简单,通常只需要比较输入值和零的大小,然后取较大值。

ReLU 的缺点:

  1. 神经元死亡问题:当输入为负数时,ReLU 的输出为零,这可能导致部分神经元在训练过程中“死亡”,即这些神经元的输出永远为零,无法再对任何数据做出响应。
  2. 非零均值问题:由于负数部分被置为零,ReLU 的输出通常不具有零均值,这可能影响后续层的训练效果

ReLU 的变种:

为了克服 ReLU 的缺点,研究者提出了多种变种激活函数,如:

  • Leaky ReLU:在负数区域引入一个小的线性分量,以避免神经元死亡问题。
  • Parametric ReLU (PReLU) :在负数区域的斜率可以作为参数进行调整,进一步优化网络性能。
  • ELU (Exponential Linear Unit) :在负数区域引入指数函数,使得输出更接近零均值,并加速学习。

应用场景:

ReLU 及其变种在卷积神经网络(CNN)和深层神经网络中被广泛使用,尤其是在图像识别、自然语言处理等领域表现优异

ReLU 是一种高效且常用的激活函数,尽管存在一些缺点,但其优点使其成为深度学习中的首选激活函数之一

零基础AI入门指南

本文以工程师的视角从零开始搭建并运行一个AI小模型,并把它完全运行起来以理解AI的工作原理,非常接地气。

AI模型是如何工作的

神经网络是AI的一种重要的计算模型,深度学习是通过神经网络实现特征学习和模式分析,大量用于图像识别等领域。我们以最基础的手写数字识别为例,看看一个神经网络的AI模型是如何工作的。

MNIST(Modified National Institute of Stands and Technology)是一个开源的数据集,它包含了6万个手写的数字图像,每个图像都是28×28黑底白字:

mnist-preview

有了这个开源的数据集,我们就可以训练一个识别手写数字的AI模型,这个练习堪称AI界的“Hello, world”。

要编写这个AI模型,我们需要使用一种称为卷积神经网络(CNN:Convolutional Neural Network)的神经网络结构,具体到代码层面,则需要使用PyTorch这样的训练框架。PyTorch底层用C++开发,外层用Python调用,非常方便易用。先确保机器安装了Python3,然后,安装PyTorch 2:

pip install torch torchvision torchaudio

如果本机有CUDA环境,也可以安装GPU版本,训练速度更快。

编写模型

准备好环境后,我们开始编写模型。先让AI写一个用CNN识别MNIST数据集的PyTorch代码:

import torch.nn as nn

class NeuralNetwork(nn.Module):
    def __init__(self):
        super().__init__()
        self.conv1 = nn.Conv2d(1, 32, 3, 1)
        self.conv2 = nn.Conv2d(32, 64, 3, 1)
        self.fc1 = nn.Linear(in_features=64 * 5 * 5, out_features=128)
        self.fc2 = nn.Linear(in_features=128, out_features=10)

    def forward(self, x):
        x = nn.functional.relu(self.conv1(x))
        x = nn.functional.max_pool2d(x, kernel_size=2)
        x = nn.functional.relu(self.conv2(x))
        x = nn.functional.max_pool2d(x, kernel_size=2)
        x = x.view(-1, 64 * 5 * 5)
        x = nn.functional.relu(self.fc1(x))
        x = self.fc2(x)
        return x

看不懂不要紧,可以接着问AI,它会告诉我们,这个神经网络定义了两个CNN卷积层和两个全连接层,总的来说就是,这个模型定义了2层卷积网络加2层全连接层,输入为1通道图片,经过卷积和池化后进入全连接层,最后输出10个分类结果,分别代表0~9这10个数字。

训练

接下来我们要使用MNIST数据集来训练这个模型。受益于PyTorch这个框架,我们连下载和读取数据集都省了,因为PyTorch已经集成了这个数据集,直接下载、加载、训练,一步到位:

from time import time

import torch
import torch.nn as nn
import torch.optim as optim

from torchvision import datasets
from torch.utils.data import DataLoader
from torchvision.transforms import ToTensor

from model import NeuralNetwork

def train(dataloader, device, model, loss_fn, optimizer):
    model.train()
    running_loss = 0.0
    for batch, (inputs, labels) in enumerate(dataloader):
        inputs = inputs.to(device)
        labels = labels.to(device)
        optimizer.zero_grad()
        outputs = model(inputs)
        loss = loss_fn(outputs, labels)
        loss.backward()
        optimizer.step()
        running_loss += loss.item()
    print(f'loss: {running_loss/len(dataloader):>0.3f}')

def test(dataloader, device, model):
    model.eval()
    correct = 0
    total = 0
    with torch.no_grad():
        for inputs, labels in dataloader:
            inputs = inputs.to(device)
            labels = labels.to(device)
            outputs = model(inputs)
            _, predicted = torch.max(outputs.data, 1)
            total += labels.size(0)
            correct += (predicted == labels).sum().item()
    print(f'accuracy: {100.0*correct/total:>0.2f} %')

def main():
    print('loading training data...')
    train_data = datasets.MNIST(
        root='./data', train=True, download=True, transform=ToTensor())
    print('loading test data...')
    test_data = datasets.MNIST(
        root='./data', train=False, download=True, transform=ToTensor())

    train_dataloader = DataLoader(train_data, batch_size=64)
    test_dataloader = DataLoader(test_data, batch_size=64)

    device = 'cuda' if torch.cuda.is_available() else 'cpu'
    print(f'using {device}')
    model = NeuralNetwork().to(device)
    print(model)

    loss_fn = nn.CrossEntropyLoss()
    optimizer = optim.Adam(model.parameters(), lr=0.001)
    epochs = 5
    for t in range(epochs):
        start_time = time()
        print(f'epoch {t+1} / {epochs}\n--------------------')
        train(train_dataloader, device, model, loss_fn, optimizer)
        test(test_dataloader, device, model)
        end_time = time()
        print(f'time: {end_time-start_time:>0.2f} seconds')
    print('done!')
    path = 'mnist.pth'
    torch.save(model.state_dict(), path)
    print(f'model saved: {path}')

if __name__ == '__main__':
    main()

数据集分两部分:一个用于训练,一个用于测试训练效果,用PyTorch的datasets.MNIST()自动下载、解压并加载数据集(解压后约55M数据,仅第一次需要下载)。然后,定义损失函数和优化器,用train()做训练,用test()测试训练效果,训练5次,运行结果如下:

$ python3 train.py
loading training data...
Downloading http://yann.lecun.com/exdb/mnist/train-images-idx3-ubyte.gz
...第一次运行会自动下载数据到data目录并解压...

loading test data...
using cpu
NeuralNetwork(
  (conv1): Conv2d(1, 32, kernel_size=(3, 3), stride=(1, 1))
  (conv2): Conv2d(32, 64, kernel_size=(3, 3), stride=(1, 1))
  (fc1): Linear(in_features=1600, out_features=128, bias=True)
  (fc2): Linear(in_features=128, out_features=10, bias=True)
)
epoch 1 / 5
--------------------
loss: 0.177
accuracy: 97.21 %
time: 30.96 seconds
epoch 2 / 5
--------------------
loss: 0.053
accuracy: 98.62 %
time: 32.24 seconds
epoch 3 / 5
--------------------
loss: 0.035
accuracy: 98.70 %
time: 33.70 seconds
epoch 4 / 5
--------------------
loss: 0.025
accuracy: 98.90 %
time: 35.10 seconds
epoch 5 / 5
--------------------
loss: 0.018
accuracy: 98.95 %
time: 32.02 seconds
done!
model saved: mnist.pth

经过5轮训练,每轮耗时约30秒(这里用CPU训练,如果是GPU则可以大大提速),准确率可以达到99%。训练结束后,将模型保存至mnist.pth文件。

使用模型

有了预训练的模型后,我们就可以用实际的手写图片测试一下。用PS手绘几张手写数字图片,测试代码如下:

import torch
from torchvision import transforms

from PIL import Image, ImageOps
from model import NeuralNetwork

device = 'cuda' if torch.cuda.is_available() else 'cpu'
print(f'using {device}')
model = NeuralNetwork().to(device)
path = './mnist.pth'
model.load_state_dict(torch.load(path))
print(f'loaded model from {path}')
print(model)

def test(path):
    print(f'test {path}...')
    image = Image.open(path).convert('RGB').resize((28, 28))
    image = ImageOps.invert(image)

    trans = transforms.Compose([
        transforms.Grayscale(1),
        transforms.ToTensor()
    ])
    image_tensor = trans(image).unsqueeze(0).to(device)
    model.eval()
    with torch.no_grad():
        output = model(image_tensor)
        probs = torch.nn.functional.softmax(output[0], 0)
    predict = torch.argmax(probs).item()
    return predict, probs[predict], probs

def main():
    for i in range(10):
        predict, prob, probs = test(f'./input/test-{i}.png')
        print(f'expected {i}, actual {predict}, {prob}, {probs}')


if __name__ == '__main__':
    main()

因为训练时输入的图片是黑底白字,而测试图片是白底黑字,所以先用PIL把图片处理成28×28的黑底白字,再测试,结果如下:

$ python3 test.py 
using cpu
loaded model from ./mnist.pth
NeuralNetwork(
  (conv1): Conv2d(1, 32, kernel_size=(3, 3), stride=(1, 1))
  (conv2): Conv2d(32, 64, kernel_size=(3, 3), stride=(1, 1))
  (fc1): Linear(in_features=1600, out_features=128, bias=True)
  (fc2): Linear(in_features=128, out_features=10, bias=True)
)
test ./input/test-0.png...
expected 0, actual 0, 0.9999996423721313, tensor([1.0000e+00, 2.3184e-10, 1.7075e-08, 7.6250e-16, 1.2966e-12, 5.7179e-11,
        2.1766e-07, 1.8820e-12, 1.1260e-07, 2.2463e-09])
...

以图片0为例,我们要使用模型,需要把输入图片变成模型可接受的参数,实际上是一个Tensor(张量),可以理解为任意维度的数组,而模型的输出也是一个Tensor,它是一个包含10个元素的1维数组,分别表示每个输出的概率。对图片0的输出如下:

  • 1.0000e+00
  • 2.3184e-10
  • 1.7075e-08
  • 7.6250e-16
  • 1.2966e-12
  • 5.7179e-11
  • 2.1766e-07
  • 1.8820e-12
  • 1.1260e-07
  • 2.2463e-09

除了第一个输出为1,其他输出都非常接近于0,可见模型以99.99996423721313%的概率认为图片是0,是其他数字的概率低到接近于0。

因此,这个MNIST模型实际上是一个图片分类器,或者说预测器,它针对任意图片输入,都会以概率形式给出10个预测,我们找出接近于1的输出,就是分类器给出的预测。

产品化

虽然我们已经有了预训练模型,也可以用模型进行手写数字识别,但是,要让用户能方便地使用这个模型,还需要进一步优化,至少需要提供一个UI。我们让AI写一个简单的页面,允许用户在页面用鼠标手写数字,然后,通过API获得识别结果:

mnist-ui

因此,最后一步是把模型的输入输出用API封装一下。因为模型基于PyTorch,所以使用Python的Flask框架是最简单的。API实现如下:

import base64
import torch
from io import BytesIO
from PIL import Image
from flask import Flask, request, redirect, jsonify
from torchvision import transforms
from model import NeuralNetwork

device = 'cuda' if torch.cuda.is_available() else 'cpu'
print(f'using {device}')
model = NeuralNetwork().to(device)
path = './mnist.pth'
model.load_state_dict(torch.load(path))
print(f'loaded model from {path}')
print(model)
params = model.state_dict()
print(params)

app = Flask(__name__)

@app.route('/')
def index():
    return redirect('/static/index.html')

@app.route('/api', methods=['POST'])
def api():
    data = request.get_json()
    image_data = base64.b64decode(data['image'])
    image = Image.open(BytesIO(image_data))
    trans = transforms.Compose([
        transforms.Grayscale(1),
        transforms.ToTensor()
    ])
    image_tensor = trans(image).unsqueeze(0).to(device)
    model.eval()
    with torch.no_grad():
        output = model(image_tensor)
        probs = torch.nn.functional.softmax(output[0], 0)
    predict = torch.argmax(probs).item()
    prob = probs[predict]
    print(f'predict: {predict}, prob: {prob}, probs: {probs}')
    return jsonify({
        'result': predict,
        'probability': prob.item()
    })

if __name__ == '__main__':
    app.run(port=5000)

上述代码实现了一个简单的API服务,注意尚未对并发访问做处理,所以只能算一个可用的DEMO。

思考

对于AI程序,我们发现,模型定义非常简单,一共也就20行代码。训练代码也很少,不超过100行。它和传统的程序最大的区别在哪呢?

无论是传统的程序,还是AI程序,在计算机看来,本质上是一样的,即给定一个输入,通过一个函数计算,获得输出。不同点在于,对于传统程序,输入是非常简单的,例如用户注册,仅仅需要几个字段,而处理函数少则几千行,多则几十万行。虽然代码量很大,但执行路径却非常清晰,通过跟踪执行,能轻易获得一个确定的执行路径,从而最终获得一个确定性的结果。确定性就是传统程序的特点,或者说,传统程序的代码量虽然大,但输入简单,路径清晰:

f(x1, x2, x3)
  │
  ▼
 ┌─┐◀─┐
 └─┘  │
  │   │
  ▼   │
 ┌─┐  │
 └─┘  │
  │   │
  ▼   │
 ┌─┐──┘
 └─┘
  │
  ▼
 ┌─┐
 └─┘

AI程序则不同,它只经过几层计算,复杂的大模型也就100来层,就可以输出结果。但是,它的输入数据量大,每一层的数据量更大,就像一个扁平的巨大函数:

       f(x1, x2, x3, ... , x998, x999, x1000)
         │   │   │   │   │   │   │   │   │
         ▼   ▼   ▼   ▼   ▼   ▼   ▼   ▼   ▼
        ┌─┐ ┌─┐ ┌─┐ ┌─┐ ┌─┐ ┌─┐ ┌─┐ ┌─┐ ┌─┐
        └─┘ └─┘ └─┘ └─┘ └─┘ └─┘ └─┘ └─┘ └─┘
         │   │   │   │   │   │   │   │   │
 ┌───┬───┼───┼───┼───┼───┼───┼───┼───┼───┼───┬───┐
 ▼   ▼   ▼   ▼   ▼   ▼   ▼   ▼   ▼   ▼   ▼   ▼   ▼
┌─┐ ┌─┐ ┌─┐ ┌─┐ ┌─┐ ┌─┐ ┌─┐ ┌─┐ ┌─┐ ┌─┐ ┌─┐ ┌─┐ ┌─┐
└─┘ └─┘ └─┘ └─┘ └─┘ └─┘ └─┘ └─┘ └─┘ └─┘ └─┘ └─┘ └─┘
 │   │   │   │   │   │   │   │   │   │   │   │   │
 └───┴───┴───┴───┼───┼───┼───┼───┼───┴───┴───┴───┘
                 ▼   ▼   ▼   ▼   ▼
                ┌─┐ ┌─┐ ┌─┐ ┌─┐ ┌─┐
                └─┘ └─┘ └─┘ └─┘ └─┘

这个函数的计算并不复杂,每一层都是简单的矩阵计算,但并行程度很高,所以需要用GPU加速。复杂度在于每一层都有大量的参数,这些参数不是开发者写死的,而是通过训练确定的,每次对参数进行微调,然后根据效果是变得更好还是更坏决定微调方向。我们这个简单的神经网络模型参数仅几万个,训练的目的实际上就是为了把这几万个参数确定下来,目标是使得识别率最高。训练这几万个参数就花了几分钟时间,如果是几亿个甚至几百亿个参数,可想而知训练所需的时间和算力都需要百万倍的增长,所以,AI模型的代码并不复杂,模型规模大但本身结构并不复杂,但为了确定模型中每一层的成千上万个参数,时间和算力主要消耗在训练上。

比较一下传统程序和AI程序的差异:

传统程序AI程序
代码量
输入参数
输出结果精确输出不确定性输出
代码参数由开发设定由训练决定
执行层次可达数百万行仅若干层网络
执行路径能精确跟踪无法跟踪
并行串行或少量并行大规模并行
计算以CPU为主以GPU为主
开发时间主要消耗在编写代码主要消耗在训练
数据主要存储用户产生的数据需要预备大量训练数据
程序质量取决于设计架构、代码优化等取决于神经网络模型和训练数据质量

传统程序的特点是精确性:精确的输入可以实现精确地执行路径,最终获得精确的结果。而AI程序则是一种概率输出,由于模型的参数是训练生成的,因此,就连开发者自己也无法知道训练后的某个参数比如0.123究竟是什么意义,调大或者调小对输出有什么影响。传统程序的逻辑是白盒,AI程序的逻辑就是黑盒,只能通过调整神经网络的规模、层次、训练集和训练方式来评估输出结果,无法事先给出一个准确的预估。

源码下载

本文源码可通过GitHub下载

AI绘画细节「替换词」大全

编写结构化提示词

  1. 选择一个「主题」,或将多个主题组合出创意;
  2. 加入各种结构、效果提示词;
  3. 微调结果;
  4. 举个例子,下面[]里表示需要替换的内容:
high-speed photography  of a [vehicle] [description] in [scene], [location], [lighting], [angle],motion blur, cinematic,  symmetrical composition , highly-detailed

[车辆] [描述] 在 [场景]、[位置]、[照明]、[角度]、运动模糊、电影感、对称构图、高度详细的情况下高速摄影

🌿 10大「主题」20+小类型

从自然风光到植物园艺,从历史时期到科幻概念,覆盖你能想到的所有创作主题。

  1. 自然风光:山川、湖泊、日落、星空、极光、海滩、森林、草原…
  2. 建筑风格:哥特式、巴洛克、现代主义、未来派、中式园林、日式庭院…
  3. 艺术流派:印象派、超现实主义、立体主义、表现主义、抽象表现…
  4. 文化元素:中国风、日韩风、波西米亚、复古、朋克、赛博朋克…
  5. 节日主题:圣诞、万圣节、复活节、春节、感恩节、情人节…
  6. 科幻概念:星际旅行、外星生物、时间旅行、黑洞、量子力学…
  7. 历史时期:古埃及、罗马帝国、中世纪、文艺复兴、工业革命…
  8. 人物形象:骑士、精灵、海盗、侦探、武士、女巫、天使、恶魔…
  9. 动物世界:狮子、狼、鹰、马、熊猫、龙、凤凰、独角兽…
  10. 植物园艺:玫瑰、薰衣草、竹、仙人掌、枫叶、樱花、向日葵…

🎨 「提升画质」

以下这些用来按需替换「提升画质」的部分:

  • highresolution 高分辨率
  • FHD,1080P,8k,16k,32k 全高清
  • highdetail 高细节
  • detailed 详细细节
  • intricatedetails 复杂细节
  • hyperquality 高品质
  • hyperrealistic 超真实
  • 35mm,50mm55mm 镜头参数
  • realistic 现实主义
  • Surrealism 超现实主义
  • UltraHDpicturequality 超高清画质
  • HDR 高动态光照渲染图像
  • unrealengine 虚幻引擎
  • 3Drendering 3D渲染
  • MaxonCinema4D 渲染
  • CoronaRender 渲染
  • architecturalvisualisation 建筑视觉化
  • photography 摄影感
  • cinematic 电影感
  • leicalens 徕卡镜头
  • scenedesign 场景设计
  • photoquality 照片质量
  • verydetailedphoto 超细节照片
  • photorealistic 照相写实主义
  • Anti-Aliasing 抗锯齿
  • PostProcessing 后期处理

图片
🖌「材质」

  • Wood 木头
  • Glass 玻璃
  • Cotton 棉花
  • Plastictexture 塑料感
  • Carvedtexture 雕刻质感
  • Lace 蕾丝
  • Stonetexture 石质
  • Celadon 青瓷
  • Enamel 琅(可能缺少了某些字母,如 “enamel”)
  • Metallicpainttexture 金属漆质感
  • Texture 纹理质感
  • Pearllustertexture 珠光质感
  • Glasstexture 玻璃质感
  • Mattetexture 亚光质感
  • Pearltexture 珍珠质感
  • Silk texture 绸缎质感
  • Fluffy texture 毛绒质感
  • metallic surfaces 金属表面
  • fluorescent neon colours 荧光色的霓虹灯
  • Water wave texture 水波纹质感
  • Graphite texture 石墨质感
  • Antique bronze texture 古铜质感
  • Brick texture 砖石质感
  • Paint texture 油漆质感
  • Gauze texture 纱绸质感
  • Clay texture 粘土质感
  • Bamboo texture 竹子质感
  • Leather texture 皮革感
  • Cotton texture 棉质
  • Crystal texture 水晶质感
  • smooth fibre textures 光滑的纤维质感
  • reflective coatings in frosted black 磨砂黑的反光涂层
  • micro and nano materials 微纳米材料
  • artificial leather 人造皮革
  • Sandy texture 沙质
  • Ceramic texture 陶瓷质感

图片
🎨 「灯光」

  • Top light 顶光
  • Raking light 侧光
  • Rim light 轮廓光
  • Edge light 边缘光
  • Volumetric light 立体光
  • Back light 逆光
  • Hard light 硬光
  • Soft light 柔光
  • Cold light 冷光
  • Warm light 暖光
  • Reflection effect 反射
  • Stark shadows 明暗分明
  • Split Lighting 分体照明
  • Mapping light 映射光
  • Volumetric lighting 层次光
  • Bright highlights 明亮高光
  • Backlighting 背光照明
  • Global illuminations 全局照明
  • Frontlighting 正面照明
  • Point light 点光源
  • Spotlight 聚光灯
  • Area light 区域灯光
  • Ambient light 环境光
  • Shadow light 阴影光
  • Ring light 环形灯
  • Texture light 纹理灯
  • Emissive material 自发光材质
  • Laser beam effect 激光束效果
  • Rainbow halo 彩虹光环
  • Glow in the dark 夜光效果
  • rays of shimmering light 微光
  • Iwinkling stars 耀星空
  • Morning light 晨光
  • Sunlight 太阳光
  • Color light 色光
  • Soft moon light 柔和月米
  • Natural light 自然光
  • Indoor lighting 室内照明
  • Outdoor lighting 室外照明
  • studio lighting 影棚光
  • cinematic dappled lighting 电影斑驳的灯光
  • Dramatic light 戏剧性的光
  • Neon light 霓虹灯光
  • Cyberpunk light 赛博朋克灯光
  • Dim light effect 暗光效果

图片
🖌「视图」

  • front 正视
  • bird 俯视
  • side 侧视
  • Bottom view 仰视
  • Full body 全身
  • Busts 半身像
  • Profile 侧面
  • headshot 特写
  • ultrawide shot 超广角
  • macro shot 微距
  • Wide view 宽景
  • Bird view 鸟瞰
  • Horizontal composition 横向构图
  • Center composition 中心构图
  • Focal point composition 焦点构图
  • S-shaped composition S形构图
  • Isolation composition 孤立构图
  • Radial composition 径向构图
  • Tunnel composition 隧道构图
  • Radial composition 放射构图
  • Repetition composition 重复构图
  • Contrast composition 对比构图
  • Overlapping composition 重叠构图
  • Juxtaposition composition 并列构图
  • Negative space composition 负空间构图
  • Collage composition 拼贴构图
  • Golden Ratio composition 黄金分割构图
  • Three-quarter view 四分之三侧视
  • Rule of thirds composition 三分法构图
  • Gisometric diorama 轴测图透视法
  • Symmetrical composition 对称构图
  • Asymmetrical composition 非对称构图
  • Diagonal composition 对角线构图
  • Converging lines composition 汇聚线条构图
  • Vanishing point composition 消失点构图

图片
艺术风格

  1. Art Deco 装饰派艺术
  2. Art Nouveau 新艺术风格
  3. Dadaism 达达主义
  4. Dutch Golden Age 荷兰黄金时代
  5. Expressionism 表现派
  6. Fauvism 野兽派
  7. Futurism 未来主义
  8. Baroque 巴洛克风格
  9. Contemporary 当代
  10. Cubism 立体派
  11. Impressionism 印象派
  12. Installation 现代雕塑
  13. Land Art 大地艺术
  14. Minimalism 极简主义
  15. Pointillism 点彩画法
  16. Pop Art 波普艺术
  17. Portraiture 肖像画
  18. Post-Impressionism 后期印象派
  19. Surrealism 超现实主义
  20. Ukiyo-e 浮世绘
  21. Watercolors 水彩画
  22. Charcoal 木炭画
  23. Pastels 蜡笔画
  24. Chalk 粉笔画
  25. Realism 现实主义
  26. Rococo 洛可可风格
  27. Romanticism 浪漫主义
  28. Still Life 静物画
  29. Graphite Pencils 铅笔画
  30. Colored Pencils 彩色铅笔画
  31. Collages 拼贴画
  32. Assemblage 集成艺术
  33. Chiaroscuro 明暗对比
  34. Foreshortening 前缩透视
  35. Gouache 水粉画
  36. Grisaille 纯灰色画
  37. Miniature Painting 微型画
  38. Mural 壁画
  39. Perspective 透视画
  40. Sand Painting 沙画
  41. Scroll Painting 卷轴画
  42. Sfumato 晕涂法
  43. Acrylic Painting 压克力胶彩绘画
  44. Aerial Perspective 透视构图
  45. Anamorphosis 失真图像
  46. Camaieu 单色配色
  47. Oil Painting 油画
  48. Panel Painting 镶板绘画
  49. Panorama 全景画
  50. Sgraffito 彩釉
  51. Found Objects 粘贴画
  52. Tromp L’Oeil 错视画

图片「艺术家」

  1. Studio Ghibli 吉卜力工作室
  2. Pablo Picasso 巴勃罗·毕加索
  3. Virgil Abloh 维吉尔·阿布洛
  4. Hayao Miyazaki 宫崎骏
  5. Hidetaka Miyazaki 宫崎英高
  6. Katsuhiro Otomo 大友克洋
  7. Katsuya Terada 寺田克也
  8. Dave Rapoza 戴夫·拉波扎
  9. Marko Djurdjevic 马尔科·久尔杰维奇
  10. Craig Mullins 克雷格·穆林斯
  11. Simon Bisley 西蒙·比斯利
  12. James Gurney 詹姆斯·格尼
  13. Peter Tarka 彼得·塔卡
  14. Victo Ngai 倪传婧
  15. Skycloud 天空之城
  16. Cool 清凉
  17. Gemi 戈末
  18. Xiaoqi 小柒
  19. Husky 哈士奇
  20. Billion Girls Dream 十亿少女的梦
  21. Nightsky 夜空
  22. Xiaotang 小棠
  23. Alphonse Mucha 阿尔方斯·穆夏
  24. Hiroshi Yoshida 吉田宏
  25. Max Ernst 马克斯·恩斯特
  26. Paul Signac 保罗·西尼亚克
  27. Salvador Dali 萨尔瓦多·达利
  28. Fli Fli 艾莉艾莉
  29. Little Trick 小妙招
  30. Anni Babe 安妮宝贝
  31. Windy Moon 风中月影
  32. Golden Bell 金铃铛
  33. M.C. Escher 埃舍尔
  34. Thomas Kinkade 托马斯·金凯德
  35. Ivan Aivazovsky 伊万·艾瓦佐夫斯基
  36. Italo Calvino 伊塔洛·卡尔维诺
  37. Donato Giancola 多纳托·詹科拉
  38. Michael Whelan 迈克尔·惠兰
  39. Frank Frazetta 弗兰克·弗雷泽塔
  40. Boris Vallejo 鲍里斯·瓦列霍
  41. Julie Bell 朱莉·贝尔
  42. Luis Royo 路易斯·罗约
  43. Ian McCaig 伊恩·麦凯格
  44. Joe Madureira 乔·马杜雷拉
  45. Norman Rockwell 诺曼·洛克威尔
  46. Albert Bierstadt 阿尔伯特·比尔施塔特
  47. Giorgio de Chirico 乔治·德·基里科
  48. Rene Magritte 雷内·马格利特
  49. Ross Tran 罗斯·特兰
  50. Marc Simonetti 马克·西蒙内蒂
  51. John Harris 约翰·哈里斯
  52. Hilma af Klint 希尔玛·克林特
  53. George Inness 乔治·因内斯
  54. William Blake 威廉·布莱克
  55. Rose Fairy 蔷薇仙子
  56. Aphrodite 阿芙罗狄蒂
  57. Red Medicine 红药
  58. RedPupil 赤瞳

画一画

猪八戒

一头黑猪,带着人体特征,尖牙,穿着中国古代衣服,愤怒眼神中有红色火焰,CG泼墨画风。

图片

哪吒:

青年哪吒,冷峻眼神,双髻发型,插画,红色和金色,火轮、天丝、龙元素,手臂着火,终极渲染,CG泼墨画风。

图片