推荐算法笔记
Created|Updated|AI
|Word Count:198|Reading Time:1mins|Post Views:
分类的话:
用户画像算法
用户画像算法、聚类算法
分类算法:
gbtd、随机森林 识别完了看哪个变量更重要。要有可解释性。
价格相关数据:体现在什么方面?一定要跟收入密切相关的。要对数据和业务的理解很重要。
分类项目:部分已知,有一部分训练集,用未知的和已知的做一个比较。打标签。寻找标签里最重要的因素。
gbtd(底层是很多决策树)。svm。dnn。可能解释性那么强。
决策树。xgbox。
输出是:分类的概率。
聚类项目:完全未知,从数据本身来发现特征。k-means。层次聚类。
输出是:不同类别的特征。
要理解商业逻辑。
Author: magicliang
Link: https://magicliang.github.io/2018/02/20/%E6%8E%A8%E8%8D%90%E7%AE%97%E6%B3%95%E7%AC%94%E8%AE%B0/
Copyright Notice: All articles on this blog are licensed under CC BY-NC-SA 4.0 unless otherwise stated.
Related Articles
2026-05-12
到底什么是多模态模型
一句话定义 多模态模型,就是能同时理解、关联和处理多种信息形态的 AI 模型。这里的“多种信息形态”包括文本、图片、音频、视频、表格、传感器数据等。 这句话里最容易被忽略的是“关联”。如果一个系统只是分别接了 OCR、语音识别、图像分类三个模块,再把结果拼在一起,那更像多工具流水线;真正的多模态模型要解决的是:不同形态的信息如何落到同一套语义判断里。 什么是“模态” 模态(modality)指信息被承载和组织的形式。不同模态不只是文件格式不同,而是底层结构、统计规律、抽象路径都不同。 模态 例子 原始形态 典型结构 文本 文章、对话、代码 字符 / token 序列 一维离散序列 图像 照片、截图、图表 像素矩阵 二维空间结构 音频 语音、音乐、环境声 波形 / 频谱 时间序列 视频 短视频、监控画面 图像帧 + 音频 + 时间 时空序列 结构化数据 表格、指标、传感器读数 字段、行列、时间戳 schema 约束下的结构 所以,“模态”的核心不是“输入文件扩展名”,而是信息在进入模型之前,本来是以什么结构存在的。 单模态与多模态的区别 单模态...
2026-03-27
Harness Engineering 完整指南:从 Prompt Engineering 到实践落地的三级跃迁
2020 年我们学会了跟模型说话(Prompt Engineering),2025 年我们学会了给模型喂信息(Context Engineering),2026 年我们学会了给模型搭脚手架(Harness Engineering)。这三个 Engineering 不是并列关系,而是严格的超集关系:PE ⊂ CE ⊂ HE。本文从"为什么上一个不够"的视角,系统梳理这条演进路径上的每一次范式跃迁,并给出从 Anthropic 实证到工程落地的完整方案。 一个类比秒懂三级跃迁 在讲技术之前,先用一个所有人都能理解的类比。 想象你要指挥一个完全失忆的天才厨师做一桌满汉全席: Prompt Engineering 就是学会怎么跟厨师下达指令。你发现说"做道好吃的"不行,得说"用中火煎三分钟,翻面后加酱油 15 毫升"。这是措辞的艺术。 Context Engineering 就是学会怎么给厨师备料。光会下指令不够——厨师面前得摆好食材、调料、菜谱、食客的过敏信息。你要设计一个动态备料系统,让厨师在需要的时候拿到需要的东西...

2026-08-03
OpenAI 与 Anthropic 知识库研究进展深度对比
大模型的知识库能力在过去两年里经历了快速迭代。OpenAI 和 Anthropic 作为这个领域最有代表性的两家公司,走出了截然不同的技术路线。一家押注"窗口越大越好",另一家选择"检索越准越好"。这种分歧不是表面的产品差异,而是反映了对"如何让 AI 有效利用外部知识"这一基本问题的不同回答。 从时间跨度上看,2023 年底到 2026 年中这段时间是知识库能力爆发式增长的阶段。两家公司几乎每个季度都有新的能力发布,而且技术路线的分化越来越明显。 这里说的"知识库"不仅仅指 RAG 或向量数据库,而是涵盖了从文档存储、检索、记忆管理到工具连接的整个链路——所有让 AI 系统能够有效利用外部知识的技术。 OpenAI:用规模碾压复杂度 OpenAI 在知识库方向上的核心策略可以概括为一句话:把上下文窗口做大,把基础设施做全,让用户把文档直接塞进去。 这个策略的底层逻辑并不复杂:如果模型能一次性「看到」所有相关信息,那检索这个步骤就变得多余。 而 OpenAI 恰好拥有最强的算力基础设施来支撑这个方向。...
2026-03-12
SDD 与超级个体:AI 时代的人机协作范式
AI 编程工具的真正价值是什么?不是"让机器替代人",而是让人工作在更高的抽象层次上。这个认知转变,带出了一系列关于人机协作、Agent 架构设计的思考——也带出了一些值得正视的批判与反思。 一、从 Vibe Coding 到 SDD:一个被误解的问题 2024-2025 年,AI 编程助手的爆发带来了一个新词汇——Vibe Coding(基于感觉的编程)。开发者与 AI 对话,AI 即时生成代码,表面上效率提升显著。 但这里有一个被普遍忽视的根本矛盾: Vibe Coding 优化的是"个人编码效率",但工程的真正瓶颈是"团队协作效率"。 一个人写代码快 10 倍,但团队沟通成本不变,整体效率提升极为有限。更糟的是,Vibe Coding 在协作层面制造了新的麻烦: PM ↔ 研发:对话历史无法作为契约,验收时各执一词,“这不是我要的” 前端 ↔ 后端:各自 vibe,联调时才发现接口格式对不上,浪费 1-2 天 后端 ↔ 后端:订单服务调用 POST /inventory/deduct,库存服务只有 PUT ...

2026-06-24
上下文管理全景:Agentic Coding 工具操纵 Messages 数组的六种策略
一次工具调用返回了几万 token 的日志。十轮之后,这段日志是否还在上下文里?如果还在,是否每轮都按普通输入价格重新结算?如果触发 compact,工具定义、Skill 和缓存又会发生什么? 这三个问题经常被混成一个问题。实际上,它们分别属于逻辑上下文、请求结构和计费统计。旧日志仍在有效上下文里,不代表它每轮都按未缓存输入计费;一次请求命中了 prompt cache,也不代表这些 token 不占 context window。 本文保留原来的六种 Messages 操纵策略,但把分析边界收紧到可验证的结构:稳定前缀、可变尾部、渐进式能力加载,以及 API usage 中可以实际测量的缓存结果。未经公开文档或请求轨迹验证的产品排名,不再作为结论。 先分清三本账 讨论上下文成本前,需要同时记三本账。 账本 记录什么 常见观测方式 上下文占用 当前请求中模型可见的 token 工具的 /context、token 估算或请求追踪 请求变动 本轮新增、删除或重写了哪些 segment 对 tools、system、messages 分段哈希 计费输入 未缓存...
2026-04-30
Warp:从终端到 ADE 的五年深研
2026 年 4 月 28 日,Warp 把客户端源码扔到了 GitHub 上,AGPL 许可,OpenAI 作为 founding sponsor,配套的云端 agent 编排平台 Oz 由 GPT 系列模型驱动。这家公司累计公开融资约 $73M,接近 100 万活跃开发者,在 SWE-bench Verified 和 Terminal-Bench 上挤进过前列,现在把"怎么造自己"这件事交给社区和 agent 一起做。 开源是一个分水岭事件,但理解这件事的意义需要往前拉。Warp 这条产品线已经走了五年,从 2020 年一个 Rust + GPU 渲染的 macOS 终端开始,一步步变成今天的 Agentic Development Environment(ADE)——包含终端、原生代码编辑、多 agent 协同、云端编排。要看懂 2025-2026 年这个窗口爆出来的所有动作,得从它 2020 年的起点开始看。 下面是一次完整的横纵深研:纵向追 Warp 从 2020 到现在的发展线,横向对齐 Cursor / Claude Code / Windsur...
Announcement
人生只是,守株待兔




