推荐算法笔记
Created|Updated|AI
|Word Count:198|Reading Time:1mins|Post Views:
分类的话:
用户画像算法
用户画像算法、聚类算法
分类算法:
gbtd、随机森林 识别完了看哪个变量更重要。要有可解释性。
价格相关数据:体现在什么方面?一定要跟收入密切相关的。要对数据和业务的理解很重要。
分类项目:部分已知,有一部分训练集,用未知的和已知的做一个比较。打标签。寻找标签里最重要的因素。
gbtd(底层是很多决策树)。svm。dnn。可能解释性那么强。
决策树。xgbox。
输出是:分类的概率。
聚类项目:完全未知,从数据本身来发现特征。k-means。层次聚类。
输出是:不同类别的特征。
要理解商业逻辑。
Author: magicliang
Link: https://magicliang.github.io/2018/02/20/%E6%8E%A8%E8%8D%90%E7%AE%97%E6%B3%95%E7%AC%94%E8%AE%B0/
Copyright Notice: All articles on this blog are licensed under CC BY-NC-SA 4.0 unless otherwise stated.
Related Articles
2026-03-23
OpenSpec 实战指南:从工作流到落地
为什么需要 OpenSpec 在 AI 编程时代,真正的难点往往不是“AI 会不会写代码”,而是“AI 能不能稳定写出你真正想要的代码”。问题往往不在模型能力,而在于需求、边界、约束和验收标准没有被稳定地表达出来。当意图没有沉淀为可复用的工程事实,AI 就只能在模糊上下文里“猜”。 OpenSpec 解决的正是这个问题。它的核心思想可以概括成一句话:先对齐规范,再生成代码(align before code)。与其把 AI 当成一个只看提示词的即时执行器,不如把它放进一套可追溯、可迭代、可沉淀的规范工作流里。 OpenSpec 既不是重量级流程平台,也不是传统瀑布式文档系统。从实践上看,它更像一套轻量的仓库内协议: 用 specs/ 保存系统当前已经成立的事实; 用 changes/ 保存本次准备引入的未来变化; 用 proposal、spec、design、tasks 把“为什么改、改成什么、怎么实现”拆开表达; 用 sync 和 archive 把一次变更逐步沉淀为下一次变更的上下文。 它的设计哲学,基本可以概括为四点: Fluid not rigid:规范是活文档,不...
2026-05-12
到底什么是多模态模型
一句话定义 多模态模型,就是能同时理解、关联和处理多种信息形态的 AI 模型。这里的“多种信息形态”包括文本、图片、音频、视频、表格、传感器数据等。 这句话里最容易被忽略的是“关联”。如果一个系统只是分别接了 OCR、语音识别、图像分类三个模块,再把结果拼在一起,那更像多工具流水线;真正的多模态模型要解决的是:不同形态的信息如何落到同一套语义判断里。 什么是“模态” 模态(modality)指信息被承载和组织的形式。不同模态不只是文件格式不同,而是底层结构、统计规律、抽象路径都不同。 模态 例子 原始形态 典型结构 文本 文章、对话、代码 字符 / token 序列 一维离散序列 图像 照片、截图、图表 像素矩阵 二维空间结构 音频 语音、音乐、环境声 波形 / 频谱 时间序列 视频 短视频、监控画面 图像帧 + 音频 + 时间 时空序列 结构化数据 表格、指标、传感器读数 字段、行列、时间戳 schema 约束下的结构 所以,“模态”的核心不是“输入文件扩展名”,而是信息在进入模型之前,本来是以什么结构存在的。 单模态与多模态的区别 单模态...
2026-05-24
情绪提示词:用心理学手段提升 LLM 性能的研究综述
在提示工程领域,有一类反直觉的发现:“对模型说好话"或者"给模型施压”,真的能让它表现更好。这不是段子,而是有严肃学术论文支撑的结论。更进一步的问题是:能不能用 gaslighting(煤气灯操控)式的心理操纵手段,系统性地提升模型性能? 本文梳理了 2023-2026 年间关于情绪提示词的学术研究,试图回答三个问题:效果有多大、机制是什么、边界在哪里。 关键发现一览 先摆结论,后面逐一展开: 研究 核心发现 提升幅度 EmotionPrompt (Li et al., 2023) 在提示词后追加情绪刺激句,多个 benchmark 显著提升 8%-115% OPRO (Google DeepMind, 2023) LLM 自动优化出"深呼吸"提示词,数学推理大幅提升 GSM8K 上从约 34% 到 80% Anthropic 可解释性研究 (2025-2026) Claude 内部存在 171 个功能性情绪表征,且因果性地影响输出 定性发现 Usman (2026) 8 种情绪框架测试,压力彻底消除诚实行为,但...
2026-03-19
子 Agent 的本质:上下文隔离与专门化
"子 Agent"这个词在多 Agent 系统的讨论中频繁出现,却鲜有人把它说清楚。它是一个能力弱化的 Agent,类似一个 Agent 化的工具?还是一个拥有更小上下文的原始 Agent,像从主 Agent fork 出来的进程?还是一个在指挥体系里听从领导 Agent、但拥有更强资源和能力的 Agent? 这三种直觉都不完全准确。本文从 Anthropic、LangChain、Claude Code 等权威来源出发,厘清子 Agent 的真实本质,并探讨一个更深层的问题:"子 Agent"究竟是能力描述,还是关系描述? 三种直觉,三种误解 在深入定义之前,先把三种常见直觉逐一检验。 误解一:子 Agent 是能力弱化的 Agent 这种直觉来自于"子"字的字面含义——子集、子系统、子进程,往往意味着更小、更弱。但 LangChain 官方文档明确指出: “An interesting aspect of this approach is that sub-agents may have the exact sa...

2026-08-03
OpenAI 与 Anthropic 知识库研究进展深度对比
大模型的知识库能力在过去两年里经历了快速迭代。OpenAI 和 Anthropic 作为这个领域最有代表性的两家公司,走出了截然不同的技术路线。一家押注"窗口越大越好",另一家选择"检索越准越好"。这种分歧不是表面的产品差异,而是反映了对"如何让 AI 有效利用外部知识"这一基本问题的不同回答。 从时间跨度上看,2023 年底到 2026 年中这段时间是知识库能力爆发式增长的阶段。两家公司几乎每个季度都有新的能力发布,而且技术路线的分化越来越明显。 这里说的"知识库"不仅仅指 RAG 或向量数据库,而是涵盖了从文档存储、检索、记忆管理到工具连接的整个链路——所有让 AI 系统能够有效利用外部知识的技术。 OpenAI:用规模碾压复杂度 OpenAI 在知识库方向上的核心策略可以概括为一句话:把上下文窗口做大,把基础设施做全,让用户把文档直接塞进去。 这个策略的底层逻辑并不复杂:如果模型能一次性「看到」所有相关信息,那检索这个步骤就变得多余。 而 OpenAI 恰好拥有最强的算力基础设施来支撑这个方向。...

2026-06-24
上下文管理全景:Agentic Coding 工具操纵 Messages 数组的六种策略
一次工具调用返回了几万 token 的日志。十轮之后,这段日志是否还在上下文里?如果还在,是否每轮都按普通输入价格重新结算?如果触发 compact,工具定义、Skill 和缓存又会发生什么? 这三个问题经常被混成一个问题。实际上,它们分别属于逻辑上下文、请求结构和计费统计。旧日志仍在有效上下文里,不代表它每轮都按未缓存输入计费;一次请求命中了 prompt cache,也不代表这些 token 不占 context window。 本文保留原来的六种 Messages 操纵策略,但把分析边界收紧到可验证的结构:稳定前缀、可变尾部、渐进式能力加载,以及 API usage 中可以实际测量的缓存结果。未经公开文档或请求轨迹验证的产品排名,不再作为结论。 先分清三本账 讨论上下文成本前,需要同时记三本账。 账本 记录什么 常见观测方式 上下文占用 当前请求中模型可见的 token 工具的 /context、token 估算或请求追踪 请求变动 本轮新增、删除或重写了哪些 segment 对 tools、system、messages 分段哈希 计费输入 未缓存...
