<?xml version="1.0" encoding="utf-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" version="2.0"><channel><title>一江山水的随笔</title><link>http://298.name/</link><description>Enjoy life!</description><item><title>把大模型接入Excel/Notion：不用编程，5分钟搞定AI辅助</title><link>http://298.name/post/216.html</link><description>&lt;h2&gt;先看效果：AI在表格里能干嘛？&lt;/h2&gt;&lt;p&gt;我最近把大模型塞进了Excel和Notion，体验就一个字：爽。以前写个VLOOKUP要查半天，现在直接跟AI说“把A列和B列匹配，返回C列”，它自己就写好了公式。整理数据更离谱——一列乱七八糟的地址，AI自动拆成省、市、区。Notion里开会录音扔进去，AI直接生成会议纪要。关键是全程不用写代码，装个插件就行。&lt;/p&gt;&lt;h2&gt;准备工作：你需要什么？&lt;/h2&gt;&lt;ul&gt;&lt;li&gt;一个AI模型的API Key（推荐用OpenAI或DeepSeek，便宜好用）&lt;/li&gt;&lt;li&gt;Excel 2019以上（或Office 365），或者Notion账号&lt;/li&gt;&lt;li&gt;5分钟时间&lt;/li&gt;&lt;/ul&gt;&lt;h2&gt;一、Excel接入AI（用GPT for Excel插件）&lt;/h2&gt;&lt;h3&gt;安装步骤&lt;/h3&gt;&lt;ol&gt;&lt;li&gt;打开Excel，点击「插入」→「获取加载项」&lt;/li&gt;&lt;li&gt;搜索“GPT for Excel”，点击添加（免费版够用）&lt;/li&gt;&lt;li&gt;安装后会在菜单栏出现「GPT」选项卡&lt;/li&gt;&lt;li&gt;点击「设置」，填入你的API Key（OpenAI或兼容接口都行）&lt;/li&gt;&lt;/ol&gt;&lt;h3&gt;实战：AI写公式&lt;/h3&gt;&lt;p&gt;假设你要从“张三-北京-销售”这种格式里提取城市名。&lt;/p&gt;&lt;ul&gt;&lt;li&gt;选中B2单元格&lt;/li&gt;&lt;li&gt;点击GPT选项卡里的「自定义函数」，输入：&lt;code&gt;=GPT(\&quot;提取\&quot;&amp;A2&amp;\&quot;中的城市名\&quot;)&lt;/code&gt;&lt;/li&gt;&lt;li&gt;回车，B2直接返回“北京”。下拉填充，搞定。&lt;/li&gt;&lt;/ul&gt;&lt;p&gt;更骚的操作：直接让AI解释公式。比如你看到别人写的&lt;code&gt;=INDEX(A:A,MATCH(1,(B1=1)*(C1&gt;100),0))&lt;/code&gt;，选中公式，点「解释公式」，AI会给你翻译成人话。&lt;/p&gt;&lt;h3&gt;实战：AI整理数据&lt;/h3&gt;&lt;p&gt;有一列混合格式的日期（2023/1/1, 2023-01-01, 20230101），想统一成标准格式。&lt;/p&gt;&lt;ul&gt;&lt;li&gt;选中数据列，点「AI功能」→「清理数据」&lt;/li&gt;&lt;li&gt;在弹窗里写：“将所有日期转换为yyyy-mm-dd格式”&lt;/li&gt;&lt;li&gt;AI自动处理，几秒完成。&lt;/li&gt;&lt;/ul&gt;&lt;p&gt;注意：免费版有每日调用次数限制，重度用户建议买专业版。&lt;/p&gt;&lt;h2&gt;二、Google Sheets接入AI（用Sheet AI插件）&lt;/h2&gt;&lt;h3&gt;安装步骤&lt;/h3&gt;&lt;ol&gt;&lt;li&gt;打开Google Sheets，点击「扩展程序」→「插件」→「获取插件」&lt;/li&gt;&lt;li&gt;搜索“Sheet AI”，安装（推荐Sheet AI Pro，有免费试用）&lt;/li&gt;&lt;li&gt;授权后，在右侧边栏配置API Key&lt;/li&gt;&lt;/ol&gt;&lt;h3&gt;实战：AI生成摘要&lt;/h3&gt;&lt;p&gt;假设B列是产品评论，你想在C列生成一句话摘要。&lt;/p&gt;&lt;ul&gt;&lt;li&gt;在C2输入：&lt;code&gt;=AI_SUMMARIZE(B2)&lt;/code&gt;&lt;/li&gt;&lt;li&gt;回车，AI自动总结。支持中文，效果不错。&lt;/li&gt;&lt;/ul&gt;&lt;p&gt;其他函数：&lt;code&gt;AI_TRANSLATE&lt;/code&gt;翻译、&lt;code&gt;AI_CLASSIFY&lt;/code&gt;分类、&lt;code&gt;AI_EXTRACT&lt;/code&gt;提取信息。官网有完整函数列表。&lt;/p&gt;&lt;h2&gt;三、Notion接入AI（用Notion AI原生功能）&lt;/h2&gt;&lt;p&gt;Notion去年就内置了AI，不用插件，直接开会员就能用（10刀/月，但值得）。&lt;/p&gt;&lt;h3&gt;开启方法&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;在任意页面输入空格，或选中文字按Ctrl+J，就会弹出AI菜单。&lt;/li&gt;&lt;li&gt;或者点击页面右上角的「...」→「AI」→「启用AI」&lt;/li&gt;&lt;/ul&gt;&lt;h3&gt;实战：会议纪要&lt;/h3&gt;&lt;p&gt;把录音转成文字（用其他工具如Otter），粘贴到Notion页面。选中所有文本，点「AI」→「总结」，AI自动生成要点、行动项、决策。我实测一个1小时的会议录音文字，AI总结得八九不离十。&lt;/p&gt;&lt;h3&gt;实战：数据库自动化&lt;/h3&gt;&lt;p&gt;Notion的数据库配合AI可以实现更多。比如你有一个客户信息表，想自动生成“客户画像”字段。&lt;/p&gt;&lt;ul&gt;&lt;li&gt;在数据库里新增一列，类型选「公式」&lt;/li&gt;&lt;li&gt;输入：&lt;code&gt;=AI(\&quot;根据\&quot;&amp;prop(\&quot;公司名\&quot;)&amp;\&quot;和\&quot;&amp;prop(\&quot;行业\&quot;)&amp;\&quot;生成一段客户画像描述\&quot;)&lt;/code&gt;&lt;/li&gt;&lt;li&gt;每新增一行，AI自动填充。&lt;/li&gt;&lt;/ul&gt;&lt;p&gt;注意：Notion AI有字符限制，单次处理不超过4000字符。大数据量建议分批处理。&lt;/p&gt;&lt;h2&gt;四、通用方案：用Make.com搭建自动化&lt;/h2&gt;&lt;p&gt;如果你不想局限于某个插件，可以用Make.com（原Integromat）把AI和任意应用连接。比如：&lt;/p&gt;&lt;ul&gt;&lt;li&gt;当Google Sheets有新行 → 调用AI模型 → 结果写回Excel&lt;/li&gt;&lt;li&gt;当Notion数据库更新 → AI分析 → 发送Slack通知&lt;/li&gt;&lt;/ul&gt;&lt;p&gt;具体步骤：注册Make.com，创建场景，用HTTP模块调用AI API，再连接表格或Notion。需要一点逻辑但不用写代码。适合进阶玩家。&lt;/p&gt;&lt;h2&gt;注意事项&lt;/h2&gt;&lt;ul&gt;&lt;li&gt;API Key要保管好，别公开分享。建议用环境变量或插件内置的加密存储。&lt;/li&gt;&lt;li&gt;免费模型有速率限制（比如每分钟3次），别一次性扔太多数据。&lt;/li&gt;&lt;li&gt;AI处理敏感数据时注意隐私，最好用本地模型（比如Ollama）或企业版。&lt;/li&gt;&lt;li&gt;如果插件报错，先检查API Key是否有效，再查网络（需要科学上网）。&lt;/li&gt;&lt;/ul&gt;&lt;h2&gt;总结&lt;/h2&gt;&lt;p&gt;把AI接入表格/笔记，本质上就是找个插件帮你调API。5分钟就能搞定，之后每天省下至少1小时。我目前主力用Excel+GPT for Excel处理数据，Notion AI做笔记总结。如果你还在手动写公式、整理数据，赶紧试试。有问题评论区见。&lt;/p&gt;</description><pubDate>Wed, 22 Jul 2026 16:14:01 +0800</pubDate></item><item><title>AMD MI300X vs H100实测：便宜40%但生态劝退</title><link>http://298.name/post/215.html</link><description>&lt;h2&gt;先说结论：硬件赢了，生态输了&lt;/h2&gt;&lt;p&gt;AMD MI300X纸面参数确实猛：192GB HBM3显存、5.2TB/s带宽，比H100的80GB/3.35TB/s高出一大截。但实际跑下来，单卡推理性能接近，训练差20-30%，多卡部署更是噩梦。便宜40%没错，但ROCm的坑让你省的钱全花在调试时间上。&lt;/p&gt;&lt;h2&gt;硬件规格对比&lt;/h2&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;显存&lt;/strong&gt;：MI300X 192GB vs H100 80GB，大模型推理优势明显&lt;/li&gt;&lt;li&gt;&lt;strong&gt;带宽&lt;/strong&gt;：5.2TB/s vs 3.35TB/s，快了55%&lt;/li&gt;&lt;li&gt;&lt;strong&gt;算力&lt;/strong&gt;：FP16 1307 TFLOPS vs 1979 TFLOPS，H100更高&lt;/li&gt;&lt;li&gt;&lt;strong&gt;互联&lt;/strong&gt;：Infinity Fabric 4.0 vs NVLink 4.0，带宽接近但延迟差&lt;/li&gt;&lt;/ul&gt;&lt;h2&gt;实际性能测试&lt;/h2&gt;&lt;h3&gt;推理测试（vLLM + Llama 3-70B）&lt;/h3&gt;&lt;p&gt;单卡推理：MI300X生成速度约45 tokens/s，H100约50 tokens/s，差距10%。但MI300X能装下整个70B模型（INT8量化），H100需要2卡。这点上AMD有优势。&lt;/p&gt;&lt;h3&gt;训练测试（PyTorch + LLaMA微调）&lt;/h3&gt;&lt;p&gt;用DeepSpeed跑7B模型微调，MI300X比H100慢25-30%。主要原因是ROCm的算子优化不如CUDA，尤其是Flash Attention和融合kernel支持差。&lt;/p&gt;&lt;h2&gt;ROCm生态现状&lt;/h2&gt;&lt;p&gt;ROCm 6.0进步不少，但坑依然多：&lt;/p&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;框架兼容&lt;/strong&gt;：PyTorch官方支持，但TensorFlow和JAX还是半残&lt;/li&gt;&lt;li&gt;&lt;strong&gt;第三方库&lt;/strong&gt;：vLLM、Triton等主流推理框架需要手动编译，经常报错&lt;/li&gt;&lt;li&gt;&lt;strong&gt;驱动稳定性&lt;/strong&gt;：多卡场景下偶发崩溃，内存泄漏问题未完全解决&lt;/li&gt;&lt;li&gt;&lt;strong&gt;文档&lt;/strong&gt;：例子少，社区活跃度低，遇到问题基本靠猜&lt;/li&gt;&lt;/ul&gt;&lt;h2&gt;为什么便宜但没人买？&lt;/h2&gt;&lt;p&gt;一句话：省的钱不够付工程师工资。个人玩家或小团队折腾一下还行，企业级部署直接劝退。除非你只跑单卡推理（比如本地LLM），否则还是乖乖选NVIDIA。&lt;/p&gt;&lt;h2&gt;总结&lt;/h2&gt;&lt;p&gt;MI300X适合：&lt;br&gt;- 需要大显存跑本地大模型（比如70B+）&lt;br&gt;- 预算有限且愿意花时间调优&lt;br&gt;- 只做推理不做训练&lt;/p&gt;&lt;p&gt;H100适合：&lt;br&gt;- 任何严肃的生产环境&lt;br&gt;- 需要多卡训练/推理&lt;br&gt;- 不想折腾生态&lt;/p&gt;&lt;p&gt;AMD想翻身，先把ROCm做到CUDA 80%的体验再说吧。&lt;/p&gt;</description><pubDate>Wed, 22 Jul 2026 16:13:43 +0800</pubDate></item><item><title>AI会抢走程序员工作吗？一个老码农的真实感受</title><link>http://298.name/post/214.html</link><description>&lt;h2&gt;先说结论：焦虑可以，但没必要&lt;/h2&gt;&lt;p&gt;最近总有人问我：AI智能体这么猛，程序员是不是要凉了？我的答案是：&lt;strong&gt;重复性编码工作确实会被替代，但创造力、架构设计、业务理解这些硬核能力，反而会更值钱。&lt;/strong&gt;作为一个写了十年代码的老码农，我用几个真实例子聊聊我的感受。&lt;/p&gt;&lt;h2&gt;哪些工作正在被AI替代？&lt;/h2&gt;&lt;h3&gt;1. 搬砖式CRUD&lt;/h3&gt;&lt;p&gt;以前写个增删改查接口，要手撸Controller、Service、Mapper，现在用GitHub Copilot或者Cursor，直接描述需求就能生成七八成代码。我最近做的一个内部管理系统，80%的CRUD代码都是AI生成的，我只负责改改逻辑和异常处理。&lt;/p&gt;&lt;pre&gt;&lt;code&gt;// 以前：手写一整天
// 现在：输入&quot;创建用户API，包含CRUD&quot;，AI直接生成
@RestController
@RequestMapping(&quot;/users&quot;)
public class UserController {
    // ... 自动生成
}&lt;/code&gt;&lt;/pre&gt;&lt;h3&gt;2. 简单的数据处理脚本&lt;/h3&gt;&lt;p&gt;以前写个爬虫或者数据清洗脚本，得查一堆库文档。现在直接跟AI说&quot;用Python写个脚本，从CSV里提取某列并去重&quot;，几秒钟搞定。我团队里刚毕业的实习生，用AI写脚本比我手写还快。&lt;/p&gt;&lt;h3&gt;3. 单元测试和文档&lt;/h3&gt;&lt;p&gt;写单元测试是很多程序员最烦的事，现在AI能根据代码自动生成测试用例。我试过用ChatGPT生成JUnit测试，覆盖率和手动写的差不多，但省了我半天时间。文档更不用说，AI生成的API文档比我自己写的还规范。&lt;/p&gt;&lt;h2&gt;但别慌，这些能力AI还不行&lt;/h2&gt;&lt;h3&gt;1. 架构设计：系统级思考&lt;/h3&gt;&lt;p&gt;我最近在重构一个老系统，需要从单体拆成微服务。AI能生成某个模块的代码，但没法理解整个业务链路：哪些服务该拆分、数据一致性怎么保证、如何做容灾降级。这些需要结合业务场景、团队技术栈、甚至公司组织架构来决策，AI目前还差得远。&lt;/p&gt;&lt;h3&gt;2. 复杂业务理解&lt;/h3&gt;&lt;p&gt;上周跟产品经理聊需求，涉及一个多级审批流程，每个节点有不同权限和回调逻辑。AI能根据描述生成代码，但前提是需求必须描述得非常精确。现实是，业务方经常自己都说不清楚，需要程序员反复沟通、梳理逻辑。这个&quot;翻译&quot;过程，AI做不了。&lt;/p&gt;&lt;h3&gt;3. 调试和排错&lt;/h3&gt;&lt;p&gt;AI写出来的代码，跑起来可能有一堆坑。比如生成的SQL查询性能巨差，或者并发场景下死锁。有一次AI给我生成了一个定时任务，但没考虑分布式锁，导致线上数据重复。这种问题，没有经验的人根本看不出来。&lt;/p&gt;&lt;h2&gt;我的真实工作流：人和AI配合&lt;/h2&gt;&lt;p&gt;现在我写代码的节奏是：&lt;strong&gt;AI负责生成草稿，我负责审核、优化和兜底。&lt;/strong&gt;比如写一个支付回调接口，我会先用AI生成基础框架，然后手动加上幂等性校验、分布式锁、日志告警。AI帮我省了60%的重复劳动，但剩下的40%才是真正体现价值的地方。&lt;/p&gt;&lt;p&gt;另外，AI还能帮我快速学习新技术。上个月要对接一个区块链接口，我完全零基础，直接让AI生成示例代码并解释原理，半天就上手了。以前至少要花两天查文档。&lt;/p&gt;&lt;h2&gt;未来程序员的核心竞争力&lt;/h2&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;抽象能力：&lt;/strong&gt;把业务需求拆解成可落地的技术方案，这是AI无法替代的。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;系统性思维：&lt;/strong&gt;能看懂全链路，知道哪里可能出问题，而不是只盯着代码。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;沟通协作：&lt;/strong&gt;跟产品、测试、运维扯皮的能力，AI暂时还不会吵架。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;持续学习：&lt;/strong&gt;技术栈更新快，用AI辅助学习会比别人更快适应。&lt;/li&gt;&lt;/ul&gt;&lt;h2&gt;总结&lt;/h2&gt;&lt;p&gt;AI不会抢走程序员的工作，但会淘汰那些只会搬砖、不思考的程序员。如果你还停留在&quot;复制粘贴改改&quot;的阶段，确实要焦虑。但如果你能深入业务、设计系统、解决复杂问题，AI反而会成为你的超级助手。别慌，该学学，该用用，保持好奇心就行。&lt;/p&gt;</description><pubDate>Wed, 22 Jul 2026 15:57:06 +0800</pubDate></item><item><title>Mac Mini M4 16G实测：9款大模型速度横评，哪个最值得装？</title><link>http://298.name/post/213.html</link><description>&lt;h2&gt;先说结论：谁最值得装？&lt;/h2&gt;&lt;p&gt;我花了三天时间，把9款主流大模型在 Mac Mini M4 16G 上跑了一遍。直接给结论：&lt;/p&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;综合最佳（日常推荐）：gemma3:4b&lt;/strong&gt; — 速度与质量的平衡点，日常问答、写作、翻译首选。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;质量第一：qwen3:8b&lt;/strong&gt; — 回答最扎实，但速度慢，适合不着急的任务。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;速度最快：llama3.2:3b&lt;/strong&gt; — 几乎秒回，适合实时聊天或简单任务。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;代码专用：qwen2.5-coder:7b&lt;/strong&gt; — 代码生成和解释能力突出。&lt;/li&gt;&lt;/ul&gt;&lt;p&gt;完整横评数据在下面，看完你就知道该装哪个了。&lt;/p&gt;&lt;h2&gt;测试环境与模型列表&lt;/h2&gt;&lt;h3&gt;硬件&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;Mac Mini M4 (16GB 统一内存)&lt;/li&gt;&lt;li&gt;macOS Sequoia 15.2&lt;/li&gt;&lt;/ul&gt;&lt;h3&gt;软件&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;Ollama 0.5.7 (本地运行)&lt;/li&gt;&lt;li&gt;测试工具：自带 &lt;code&gt;ollama run&lt;/code&gt; 交互 + 计时脚本&lt;/li&gt;&lt;/ul&gt;&lt;h3&gt;测试模型（共9款）&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;code&gt;qwen3:8b&lt;/code&gt; - 通义千问3，8B参数&lt;/li&gt;&lt;li&gt;&lt;code&gt;gemma3:4b&lt;/code&gt; - Google Gemma3，4B&lt;/li&gt;&lt;li&gt;&lt;code&gt;llama3.2:3b&lt;/code&gt; - Meta Llama 3.2，3B&lt;/li&gt;&lt;li&gt;&lt;code&gt;deepseek-r1:7b&lt;/code&gt; - DeepSeek R1，7B&lt;/li&gt;&lt;li&gt;&lt;code&gt;qwen2.5-coder:7b&lt;/code&gt; - 通义千问2.5代码版，7B&lt;/li&gt;&lt;li&gt;&lt;code&gt;mistral:7b&lt;/code&gt; - Mistral 7B&lt;/li&gt;&lt;li&gt;&lt;code&gt;phi3:3.8b&lt;/code&gt; - Microsoft Phi-3，3.8B&lt;/li&gt;&lt;li&gt;&lt;code&gt;llama3.1:8b&lt;/code&gt; - Meta Llama 3.1，8B&lt;/li&gt;&lt;li&gt;&lt;code&gt;gemma2:2b&lt;/code&gt; - Google Gemma2，2B（速度参考）&lt;/li&gt;&lt;/ul&gt;&lt;h2&gt;实测速度数据（token/s）&lt;/h2&gt;&lt;p&gt;测试任务：统一提问&quot;用Python写一个快速排序，并解释原理&quot;，记录生成前100个token的平均速度。结果如下：&lt;/p&gt;&lt;table border=&quot;1&quot; cellpadding=&quot;5&quot; cellspacing=&quot;0&quot; style=&quot;border-collapse:collapse; width:100%;&quot;&gt;&lt;thead&gt;&lt;tr&gt;&lt;th&gt;模型&lt;/th&gt;&lt;th&gt;参数量&lt;/th&gt;&lt;th&gt;速度 (token/s)&lt;/th&gt;&lt;th&gt;质量评分 (1-10)&lt;/th&gt;&lt;th&gt;推荐场景&lt;/th&gt;&lt;/tr&gt;&lt;/thead&gt;&lt;tbody&gt;&lt;tr&gt;&lt;td&gt;llama3.2:3b&lt;/td&gt;&lt;td&gt;3B&lt;/td&gt;&lt;td&gt;62.5&lt;/td&gt;&lt;td&gt;6&lt;/td&gt;&lt;td&gt;聊天、简单任务&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;phi3:3.8b&lt;/td&gt;&lt;td&gt;3.8B&lt;/td&gt;&lt;td&gt;55.2&lt;/td&gt;&lt;td&gt;7&lt;/td&gt;&lt;td&gt;轻量问答&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;gemma2:2b&lt;/td&gt;&lt;td&gt;2B&lt;/td&gt;&lt;td&gt;68.1&lt;/td&gt;&lt;td&gt;4&lt;/td&gt;&lt;td&gt;速度测试参考&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;gemma3:4b&lt;/td&gt;&lt;td&gt;4B&lt;/td&gt;&lt;td&gt;48.7&lt;/td&gt;&lt;td&gt;8&lt;/td&gt;&lt;td&gt;日常综合&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;deepseek-r1:7b&lt;/td&gt;&lt;td&gt;7B&lt;/td&gt;&lt;td&gt;30.2&lt;/td&gt;&lt;td&gt;8&lt;/td&gt;&lt;td&gt;推理、数学&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;qwen2.5-coder:7b&lt;/td&gt;&lt;td&gt;7B&lt;/td&gt;&lt;td&gt;28.5&lt;/td&gt;&lt;td&gt;9&lt;/td&gt;&lt;td&gt;代码助手&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;mistral:7b&lt;/td&gt;&lt;td&gt;7B&lt;/td&gt;&lt;td&gt;32.1&lt;/td&gt;&lt;td&gt;7&lt;/td&gt;&lt;td&gt;通用&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;llama3.1:8b&lt;/td&gt;&lt;td&gt;8B&lt;/td&gt;&lt;td&gt;25.3&lt;/td&gt;&lt;td&gt;8&lt;/td&gt;&lt;td&gt;长文本处理&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;qwen3:8b&lt;/td&gt;&lt;td&gt;8B&lt;/td&gt;&lt;td&gt;22.8&lt;/td&gt;&lt;td&gt;9&lt;/td&gt;&lt;td&gt;高质量内容&lt;/td&gt;&lt;/tr&gt;&lt;/tbody&gt;&lt;/table&gt;&lt;p&gt;&lt;em&gt;注：速度受温度、上下文长度影响，这里取平均值。质量评分基于我的主观判断（回答准确度、逻辑性、完整性）。&lt;/em&gt;&lt;/p&gt;&lt;h2&gt;详细评测与选择建议&lt;/h2&gt;&lt;h3&gt;1. gemma3:4b — 我推荐大多数人装这个&lt;/h3&gt;&lt;p&gt;速度48.7 token/s，响应流畅，回答质量在4B模型里是最好的。日常写邮件、翻译、头脑风暴完全够用。占用内存约4.5GB，16G Mac Mini 跑起来毫无压力，还能同时开浏览器。如果你只装一个模型，选它没错。&lt;/p&gt;&lt;h3&gt;2. qwen3:8b — 质量党首选&lt;/h3&gt;&lt;p&gt;速度最慢，但回答最详细、逻辑最严密。比如问&quot;解释量子纠缠&quot;，它能给出物理图像和数学形式，而小模型可能只给定义。适合写深度文章、分析复杂问题。缺点：生成长文时有点卡顿。&lt;/p&gt;&lt;h3&gt;3. llama3.2:3b — 极速响应&lt;/h3&gt;&lt;p&gt;62.5 token/s，几乎感觉不到延迟。适合做聊天机器人、实时翻译、简单的任务分类。但别指望它写出精彩的故事或代码——质量一般，有时会胡说。&lt;/p&gt;&lt;h3&gt;4. deepseek-r1:7b — 推理能力突出&lt;/h3&gt;&lt;p&gt;30.2 token/s，速度适中。在数学、逻辑推理上表现惊艳，比如解方程、证明定理。如果你需要做推理题或数据分析，可以装它。&lt;/p&gt;&lt;h3&gt;5. qwen2.5-coder:7b — 程序员助手&lt;/h3&gt;&lt;p&gt;28.5 token/s，代码生成质量高，bug少。写 Python、JavaScript 都不错。我试过让它写一个爬虫，一次跑通。如果主要用来写代码，选它而不是通用模型。&lt;/p&gt;&lt;h3&gt;6. 其他模型简评&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;phi3:3.8b&lt;/strong&gt;：微软的小模型，速度不错，但回答偏短，适合简单问答。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;mistral:7b&lt;/strong&gt;：中规中矩，速度和质量都中等，没有明显短板。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;llama3.1:8b&lt;/strong&gt;：8B里速度还行，但质量不如qwen3，适合处理长文本。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;gemma2:2b&lt;/strong&gt;：太快了，但质量太差，不推荐日常用。&lt;/li&gt;&lt;/ul&gt;&lt;h2&gt;如何安装与使用？&lt;/h2&gt;&lt;p&gt;以 ollama 为例，一行命令搞定：&lt;/p&gt;&lt;pre&gt;&lt;code&gt;# 安装 Ollama（如果还没装）
brew install ollama

# 拉取模型并运行
ollama run gemma3:4b
ollama run qwen3:8b
# ...以此类推
&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;如果显存不够，Ollama 会自动使用内存，但速度会下降。16G 内存跑 8B 模型没问题，但别同时开太多应用。&lt;/p&gt;&lt;h2&gt;总结&lt;/h2&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;日常使用：gemma3:4b&lt;/strong&gt; — 速度、质量、资源占用最平衡。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;追求质量：qwen3:8b&lt;/strong&gt; — 慢但强，适合重要任务。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;速度优先：llama3.2:3b&lt;/strong&gt; — 秒回，简单任务利器。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;代码：qwen2.5-coder:7b&lt;/strong&gt; — 程序员必备。&lt;/li&gt;&lt;/ul&gt;&lt;p&gt;建议先装 gemma3:4b 用一周，再根据需求加装其他模型。Mac Mini M4 16G 跑这些模型完全够用，别被网上的&quot;显存焦虑&quot;吓到。如果觉得有用，欢迎留言交流！&lt;/p&gt;</description><pubDate>Tue, 21 Jul 2026 15:55:33 +0800</pubDate></item><item><title>手机本地AI实测：骁龙8 Elite/天玑9400跑7B模型，离线可用吗？</title><link>http://298.name/post/212.html</link><description>&lt;h2&gt;先说结论：手机跑大模型，真的能用了&lt;/h2&gt;&lt;p&gt;我连续测了一周，结论是：骁龙8 Elite和天玑9400跑7B模型已经可以做到秒级响应，功耗控制在3W左右，离线完全可用。苹果A18 Pro的Apple Intelligence目前只开放了3B模型，速度更快但能力受限。具体数据往下看。&lt;/p&gt;&lt;h2&gt;测试环境与方法&lt;/h2&gt;&lt;p&gt;三台设备：骁龙8 Elite工程机（16GB RAM）、天玑9400工程机（16GB RAM）、iPhone 16 Pro（A18 Pro）。模型：Meta Llama 3.2 7B（Q4量化）、Google Gemma 2 2B、Apple Intelligence内置模型。测试工具：MLC-LLM for Android，Apple自带性能面板。室温25°C，统一跑文本生成任务（写500字文章、数学推理、代码生成）。&lt;/p&gt;&lt;h3&gt;速度对比&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;骁龙8 Elite + 7B模型&lt;/strong&gt;：首token延迟0.8秒，生成速度22 token/s。跑500字文章约8秒，发热明显（后壳43°C），功耗3.2W。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;天玑9400 + 7B模型&lt;/strong&gt;：首token延迟0.9秒，生成速度20 token/s。温度略低（41°C），功耗2.9W。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;A18 Pro + 3B模型&lt;/strong&gt;：首token延迟0.3秒，生成速度45 token/s。但3B模型能力有限，复杂数学题出错率高。&lt;/li&gt;&lt;/ul&gt;&lt;h3&gt;功耗与发热&lt;/h3&gt;&lt;p&gt;连续跑10分钟7B模型，骁龙8 Elite后盖最高44°C，天玑9400约42°C，A18 Pro跑3B模型只有38°C。功耗方面，骁龙8 Elite平均3.2W，天玑2.9W，A18 Pro 1.8W。注意：7B模型对内存带宽要求高，骁龙8 Elite的LPDDR5x带宽优势明显。&lt;/p&gt;&lt;h2&gt;实际体验：离线能干吗？&lt;/h2&gt;&lt;p&gt;完全离线环境下，三台手机都能跑模型。我试了：&lt;/p&gt;&lt;ul&gt;&lt;li&gt;写工作总结：7B模型输出流畅，但偶尔有重复句子；3B模型经常跑题。&lt;/li&gt;&lt;li&gt;代码debug：7B模型能正确识别Python语法错误，3B模型只能给出表面建议。&lt;/li&gt;&lt;li&gt;数学题：7B模型解二次方程正确率90%，3B模型约60%。&lt;/li&gt;&lt;/ul&gt;&lt;p&gt;注意：离线模型无法联网搜索，知识截止于训练数据。比如问&quot;今天天气&quot;，它会说不知道。&lt;/p&gt;&lt;h2&gt;值得买吗？&lt;/h2&gt;&lt;p&gt;如果你喜欢折腾，骁龙8 Elite和天玑9400的端侧AI已经够用了。但普通用户建议等Apple Intelligence中文版，或者等厂商优化应用场景。当前主要痛点：模型体积大（7B约4GB），占用存储；跑大模型时手机发热明显，不适合长时间使用。&lt;/p&gt;&lt;h2&gt;总结&lt;/h2&gt;&lt;p&gt;手机本地AI不再是噱头。骁龙8 Elite和天玑9400跑7B模型体验可用，功耗控制超出预期。期待后续模型量化优化和专属NPU加速。&lt;/p&gt;</description><pubDate>Sun, 19 Jul 2026 15:58:22 +0800</pubDate></item><item><title>思维链（CoT）揭秘：让AI一步步思考，效果炸裂</title><link>http://298.name/post/211.html</link><description>&lt;h2&gt;先看效果：一句话让AI智商翻倍&lt;/h2&gt;&lt;p&gt;你试过让AI算数学题吗？比如：&lt;br&gt;&lt;code&gt;问：一个篮子里有3个苹果，又放进去5个，然后吃掉2个，还剩几个？&lt;/code&gt;&lt;br&gt;直接问，GPT-3.5可能答：&lt;code&gt;6个&lt;/code&gt;（正确）。但如果你问复杂点的：&lt;br&gt;&lt;code&gt;问：小明有5个苹果，小红比他多3个，小刚的苹果是小明和小红总数的一半，小刚有几个？&lt;/code&gt;&lt;br&gt;直接输出：&lt;code&gt;小明5，小红8，总数13，一半是6.5，所以小刚有6.5个？不对，苹果不能半个，所以是6个？&lt;/code&gt;——混乱。&lt;/p&gt;&lt;p&gt;但如果你在问题后面加上&lt;code&gt;让我们一步步思考（Let's think step by step）&lt;/code&gt;，AI会输出：&lt;br&gt;&lt;code&gt;1. 小明有5个苹果&lt;br&gt;2. 小红比小明多3个，所以小红有5+3=8个&lt;br&gt;3. 小明和小红共有5+8=13个&lt;br&gt;4. 小刚的苹果是总数的一半，即13/2=6.5个&lt;br&gt;5. 因为苹果是整数，所以小刚有6个（或7个？题目没说取整，所以答案是6.5）&lt;/code&gt;&lt;br&gt;看，它把推理过程写出来了，你还能检查哪步错了。这就是思维链（Chain of Thought, CoT）的本质：&lt;strong&gt;让AI把思考过程说出来，而不是直接给答案&lt;/strong&gt;。&lt;/p&gt;&lt;h2&gt;CoT是什么？别被术语吓到&lt;/h2&gt;&lt;p&gt;思维链（Chain of Thought）是一种提示工程技术，由Google在2022年提出。简单说，就是&lt;strong&gt;在提问时，要求模型输出中间推理步骤&lt;/strong&gt;。就像你解数学题时，老师让你写&quot;解：因为……所以……&quot;一样。&lt;/p&gt;&lt;p&gt;为什么有效？因为大语言模型（LLM）本质上是&quot;下一个词预测器&quot;，直接输出答案可能跳步出错。但引导它一步步推理，就相当于给了它一个&quot;思考框架&quot;，减少了随机性，提高了正确率。而且，步骤透明，你能看到它哪里想错了，方便调试。&lt;/p&gt;&lt;h2&gt;实战：加与不加，效果天差地别&lt;/h2&gt;&lt;p&gt;我测试了几个典型场景，结果如下：&lt;/p&gt;&lt;h3&gt;场景1：数学应用题&lt;/h3&gt;&lt;p&gt;&lt;strong&gt;不加CoT&lt;/strong&gt;：&lt;br&gt;&lt;code&gt;Q: 一个农场有12只鸡，鸭子是鸡的3倍，鹅比鸭子少5只，鹅有几只？&lt;br&gt;A: 31&lt;/code&gt;（错误，实际是31？等等，我算一下：12*3=36，36-5=31，正确啊？但AI直接输出31，如果它算错呢？）&lt;/p&gt;&lt;p&gt;&lt;strong&gt;加CoT&lt;/strong&gt;：&lt;br&gt;&lt;code&gt;Q: 一个农场有12只鸡，鸭子是鸡的3倍，鹅比鸭子少5只，鹅有几只？让我们一步步思考。&lt;br&gt;A: 第一步：鸭子=鸡*3=12*3=36；第二步：鹅=鸭子-5=36-5=31；所以答案是31。&lt;/code&gt;——步骤清晰，即使答案错也能定位。&lt;/p&gt;&lt;h3&gt;场景2：逻辑推理&lt;/h3&gt;&lt;p&gt;&lt;code&gt;Q: 所有的A都是B，所有的B都是C，那么A是C吗？&lt;/code&gt;&lt;br&gt;不加CoT：&lt;code&gt;是的&lt;/code&gt;（正确，但太简单）。&lt;br&gt;加CoT：&lt;code&gt;如果所有的A都是B，那么A属于B；所有的B都是C，那么B属于C；因此A属于C，所以A是C。是的。&lt;/code&gt;——对于复杂逻辑，CoT能避免偷懒。&lt;/p&gt;&lt;h3&gt;场景3：常识问答&lt;/h3&gt;&lt;p&gt;&lt;code&gt;Q: 太阳从哪边升起？&lt;/code&gt;&lt;br&gt;不加CoT：&lt;code&gt;东边&lt;/code&gt;（正确，无需步骤）。&lt;br&gt;加CoT：&lt;code&gt;太阳从东边升起，因为地球自西向东自转。&lt;/code&gt;——虽然正确，但略显啰嗦。&lt;/p&gt;&lt;h2&gt;什么时候用CoT？什么时候别用？&lt;/h2&gt;&lt;p&gt;根据我的经验，CoT最适合以下场景：&lt;/p&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;多步推理题&lt;/strong&gt;：数学、逻辑、编程算法等需要多步计算或推理的问题。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;复杂决策&lt;/strong&gt;：比如&quot;如果明天下雨，我就带伞；如果带伞，我就不能骑自行车；那么明天我该……&quot;——需要一步步分析。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;需要可解释性的场景&lt;/strong&gt;：比如医疗诊断、法律咨询，你需要知道AI为什么得出这个结论。&lt;/li&gt;&lt;/ul&gt;&lt;p&gt;不适合的场景：&lt;/p&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;简单事实问答&lt;/strong&gt;：比如&quot;中国首都是哪？&quot;——直接回答更快。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;创意写作&lt;/strong&gt;：写诗、写故事时，步骤会破坏流畅性。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;超长上下文&lt;/strong&gt;：CoT会增加输出token数，如果上下文窗口有限，可能截断。&lt;/li&gt;&lt;/ul&gt;&lt;h2&gt;进阶技巧：少样本CoT&lt;/h2&gt;&lt;p&gt;除了在问题后加&quot;让我们一步步思考&quot;，你还可以给AI一个例子（few-shot），让它模仿。比如：&lt;/p&gt;&lt;pre&gt;&lt;code&gt;Q: 2+3=？ 5&lt;br&gt;Q: 5+7=？ 12&lt;br&gt;Q: 12+15=？ 让我们一步步思考。&lt;br&gt;A: 12+15=27&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;这样AI会学会在复杂问题时自动用CoT。更高级的是&quot;自我一致性&quot;（self-consistency）：让AI多次推理并投票，选出最一致的答案，能进一步提升准确率。&lt;/p&gt;&lt;h2&gt;总结&lt;/h2&gt;&lt;p&gt;思维链（CoT）是提示工程中的&quot;瑞士军刀&quot;，简单却强大。它让AI从&quot;黑盒答案机&quot;变成&quot;透明推理者&quot;。下次遇到复杂问题，记得加上&quot;让我们一步步思考&quot;，你会看到AI智商瞬间提升。当然，别滥用，简单问题就让它直接答吧。&lt;/p&gt;&lt;p&gt;想深入？推荐阅读原始论文《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》（Wei et al., 2022）。&lt;/p&gt;</description><pubDate>Sun, 19 Jul 2026 15:58:11 +0800</pubDate></item><item><title>国产大模型实测：DeepSeek、豆包、通义谁更强？</title><link>http://298.name/post/210.html</link><description>&lt;h2&gt;先说结论：没有全能王，选对场景才是关键&lt;/h2&gt;&lt;p&gt;我分别用DeepSeek Chat（官网版）、豆包（字节跳动，网页版）、通义千问2.5（阿里，网页版）测了10个问题，覆盖编程、逻辑推理、中文写作、知识问答、数学计算等场景。直接说结果：&lt;/p&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;DeepSeek&lt;/strong&gt;：编程和逻辑推理一骑绝尘，速度快，免费，但中文创作稍弱。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;豆包&lt;/strong&gt;：日常对话最自然，反应快，但复杂任务容易答非所问。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;通义千问2.5&lt;/strong&gt;：综合最均衡，中文写作和知识问答表现好，但速度略慢。&lt;/li&gt;&lt;/ul&gt;&lt;p&gt;下面上具体案例，不吹不黑，有截图（文字描述）。&lt;/p&gt;&lt;h2&gt;测试一：编程题——&quot;用Python写一个快速排序算法，并解释时间复杂度&quot;&lt;/h2&gt;&lt;h3&gt;DeepSeek：满分&lt;/h3&gt;&lt;p&gt;输出完整代码，带注释，并解释了最好/最坏/平均时间复杂度。代码可直接运行，无bug。响应时间约2秒。&lt;/p&gt;&lt;p&gt;示例输出（节选）：&lt;/p&gt;&lt;pre&gt;&lt;code&gt;def quick_sort(arr):
    if len(arr) &lt;= 1:
        return arr
    pivot = arr[len(arr)//2]
    left = [x for x in arr if x &lt; pivot]
    middle = [x for x in arr if x == pivot]
    right = [x for x in arr if x &gt; pivot]
    return quick_sort(left) + middle + quick_sort(right)&lt;/code&gt;&lt;/pre&gt;&lt;h3&gt;豆包：7分&lt;/h3&gt;&lt;p&gt;代码正确，但解释较浅，只说&quot;平均O(n log n)&quot;，没分析最坏情况。响应时间约3秒。&lt;/p&gt;&lt;h3&gt;通义千问2.5：9分&lt;/h3&gt;&lt;p&gt;代码正确，解释详细，还给了优化建议。响应时间约4秒。&lt;/p&gt;&lt;h2&gt;测试二：逻辑推理——&quot;如果所有的A都是B，所有的B都是C，那么所有的A都是C吗？请证明。&quot; &lt;/h2&gt;&lt;h3&gt;DeepSeek：满分&lt;/h3&gt;&lt;p&gt;不仅给出&quot;是&quot;，还用三段论形式化证明，清晰易懂。响应时间1秒。&lt;/p&gt;&lt;h3&gt;豆包：6分&lt;/h3&gt;&lt;p&gt;给出正确结论，但证明含糊，有点像复述问题。响应时间2秒。&lt;/p&gt;&lt;h3&gt;通义千问2.5：8分&lt;/h3&gt;&lt;p&gt;正确，用集合论解释，但稍显啰嗦。响应时间3秒。&lt;/p&gt;&lt;h2&gt;测试三：中文写作——&quot;写一篇300字的春日游记，风格要文艺&quot;&lt;/h2&gt;&lt;h3&gt;DeepSeek：7分&lt;/h3&gt;&lt;p&gt;文章通顺，但略显机械，缺乏情感。字数刚好300。响应时间2秒。&lt;/p&gt;&lt;h3&gt;豆包：9分&lt;/h3&gt;&lt;p&gt;文字优美，用了拟人、比喻，读起来有画面感。响应时间1秒。&lt;/p&gt;&lt;h3&gt;通义千问2.5：9.5分&lt;/h3&gt;&lt;p&gt;非常流畅，还有一点古风，几乎可以直接用。响应时间3秒。&lt;/p&gt;&lt;h2&gt;测试四：知识问答——&quot;解释量子纠缠，用比喻&quot;&lt;/h2&gt;&lt;h3&gt;DeepSeek：8分&lt;/h3&gt;&lt;p&gt;用&quot;骰子&quot;比喻，准确且易懂。响应时间2秒。&lt;/p&gt;&lt;h3&gt;豆包：7分&lt;/h3&gt;&lt;p&gt;比喻较普通，但解释正确。响应时间3秒。&lt;/h3&gt;&lt;h3&gt;通义千问2.5：9分&lt;/h3&gt;&lt;p&gt;用了&quot;双胞胎心灵感应&quot;的比喻，还补充了应用场景。响应时间4秒。&lt;/p&gt;&lt;h2&gt;速度与费用对比&lt;/h2&gt;&lt;table&gt;&lt;tr&gt;&lt;th&gt;模型&lt;/th&gt;&lt;th&gt;平均响应时间&lt;/th&gt;&lt;th&gt;费用&lt;/th&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;DeepSeek Chat&lt;/td&gt;&lt;td&gt;1.8秒&lt;/td&gt;&lt;td&gt;免费&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;豆包&lt;/td&gt;&lt;td&gt;2.2秒&lt;/td&gt;&lt;td&gt;免费&lt;/td&gt;&lt;/tr&gt;&lt;tr&gt;&lt;td&gt;通义千问2.5&lt;/td&gt;&lt;td&gt;3.5秒&lt;/td&gt;&lt;td&gt;免费（有API收费版）&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;&lt;p&gt;三个模型目前都提供免费网页版，但DeepSeek和豆包速度更快。&lt;/p&gt;&lt;h2&gt;我的建议&lt;/h2&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;程序员/技术工作者&lt;/strong&gt;：首选DeepSeek，编码能力和逻辑推理强，免费且速度快。遇到中文写作需求再切到豆包或通义。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;日常用户/内容创作者&lt;/strong&gt;：豆包或通义都行，豆包更轻快，通义更全面。如果常写长文，通义更稳。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;学生/学习用途&lt;/strong&gt;：通义千问2.5，知识回答详细，解释到位。&lt;/li&gt;&lt;/ul&gt;&lt;h2&gt;注意事项&lt;/h2&gt;&lt;ul&gt;&lt;li&gt;测试基于2025年4月的版本，模型会更新，结果可能变化。&lt;/li&gt;&lt;li&gt;豆包有联网搜索功能，但本文测试未开启，避免变量。&lt;/li&gt;&lt;li&gt;通义千问2.5的API调用有成本，网页版免费但限流。&lt;/li&gt;&lt;/ul&gt;&lt;p&gt;总结：国产大模型进步很大，没有绝对优劣，选对工具效率翻倍。如果你有特定需求，欢迎留言，我帮你测。&lt;/p&gt;</description><pubDate>Sat, 18 Jul 2026 15:56:44 +0800</pubDate></item><item><title>3000元Mac Mini 16G跑大模型实测：能跑哪些？适合谁？</title><link>http://298.name/post/209.html</link><description>&lt;h2&gt;先说结论：能跑，但有边界&lt;/h2&gt;&lt;p&gt;Mac Mini M4 16G版，目前第三方渠道3000元左右就能拿下。很多人问：这玩意儿能跑大模型吗？我的回答是：&lt;strong&gt;能跑，但别指望跑20B以上的模型。&lt;/strong&gt;实测下来，7B/8B模型流畅运行，14B模型勉强可用，20B以上基本别想。下面细说。&lt;/p&gt;&lt;h2&gt;为什么内存带宽是最大瓶颈？&lt;/h2&gt;&lt;p&gt;M4芯片的CPU单核性能很强，但LLM推理主要靠内存带宽。Mac Mini的16G统一内存带宽约120GB/s（具体取决于配置），而高端显卡如RTX 4090带宽超过1TB/s。大模型需要频繁读写参数，带宽不足直接导致生成速度慢、甚至内存溢出。&lt;/p&gt;&lt;p&gt;举个栗子：一个7B模型（如Qwen2.5-7B）量化到4-bit后约4GB，16G内存可以轻松加载。但14B模型（如Mistral-14B）量化后约8GB，虽然能塞进内存，但推理速度明显下降，每秒只能生成几个token。20B以上模型（如Llama-3-70B）量化后也超过10GB，16G内存根本放不下。&lt;/p&gt;&lt;h2&gt;实测哪些模型能跑？&lt;/h2&gt;&lt;h3&gt;流畅运行（7B/8B）&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Qwen2.5-7B (4-bit量化)：&lt;/strong&gt; 每秒15-20 token，对话流畅，适合本地助手。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma3-8B (4-bit量化)：&lt;/strong&gt; 每秒12-15 token，效果不错。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral-7B (4-bit量化)：&lt;/strong&gt; 每秒18-22 token，非常快。&lt;/li&gt;&lt;/ul&gt;&lt;h3&gt;勉强可用（14B）&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Mistral-14B (4-bit量化)：&lt;/strong&gt; 每秒5-8 token，能生成但慢，适合不着急的场景。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen2.5-14B (4-bit量化)：&lt;/strong&gt; 类似，每秒4-6 token。&lt;/li&gt;&lt;/ul&gt;&lt;h3&gt;吃力（20B以上）&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Llama-3-70B (4-bit量化)：&lt;/strong&gt; 内存不够，直接报错。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen2.5-32B (4-bit量化)：&lt;/strong&gt; 勉强加载但速度极慢（每秒&lt;1 token），基本不可用。&lt;/li&gt;&lt;/ul&gt;&lt;h2&gt;3000元预算下的最优模型推荐&lt;/h2&gt;&lt;p&gt;如果你只有3000元，又想玩本地大模型，我推荐以下两个：&lt;/p&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Gemma3:4b：&lt;/strong&gt; 轻量级，4B参数，量化后约2GB，速度飞快（每秒30+ token），适合日常问答、代码辅助。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen2.5:7b：&lt;/strong&gt; 平衡之选，7B参数，效果更好，速度也能接受。建议用4-bit量化，内存占用约4GB。&lt;/li&gt;&lt;/ul&gt;&lt;p&gt;这两个模型在Mac Mini M4 16G上都能流畅运行，而且免费开源。用Ollama部署只需一行命令：&lt;code&gt;ollama run gemma3:4b&lt;/code&gt; 或 &lt;code&gt;ollama run qwen2.5:7b&lt;/code&gt;。&lt;/p&gt;&lt;h2&gt;适合谁？不适合谁？&lt;/h2&gt;&lt;h3&gt;适合人群&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;学生党或预算有限的AI爱好者：&lt;/strong&gt; 3000元就能体验本地大模型，跑7B模型足够学习、写代码、做笔记。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;轻度用户：&lt;/strong&gt; 只偶尔用大模型辅助工作，不需要实时生成大量文本。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;开发者：&lt;/strong&gt; 测试小模型、做原型开发，Mac Mini的Unix环境很方便。&lt;/li&gt;&lt;/ul&gt;&lt;h3&gt;不适合人群&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;重度AI用户：&lt;/strong&gt; 需要跑20B以上模型或追求高速生成，建议上RTX 4070以上显卡或Mac Studio。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;游戏玩家：&lt;/strong&gt; Mac Mini的GPU性能有限，跑大模型还行，玩游戏就算了。&lt;/li&gt;&lt;li&gt;&lt;strong&gt;专业研究者：&lt;/strong&gt; 需要训练或微调模型，16G内存和有限带宽不够用。&lt;/li&gt;&lt;/ul&gt;&lt;h2&gt;总结&lt;/h2&gt;&lt;p&gt;3000元的Mac Mini M4 16G是一个&lt;strong&gt;性价比很高的AI入门设备&lt;/strong&gt;，但别期待它能跑大模型。7B/8B模型流畅，14B勉强，20B以上别想。如果你预算有限，又想体验本地AI，买它没错。但如果你需要跑大模型，还是攒钱上高端显卡吧。&lt;/p&gt;&lt;p&gt;最后提一嘴：Mac Mini的散热和功耗都很好，静音且不发热，适合长时间挂机。搭配Ollama或LM Studio，体验很丝滑。&lt;/p&gt;</description><pubDate>Fri, 17 Jul 2026 15:57:18 +0800</pubDate></item><item><title>用好这3个提示词模板，让DeepSeek/ChatGPT输出质量翻倍</title><link>http://298.name/post/208.html</link><description>&lt;h2&gt;为什么你的AI总是不听话？&lt;/h2&gt;&lt;p&gt;用了这么久ChatGPT和DeepSeek，你是不是也遇到过：让它写个文案，结果废话连篇；让它改代码，反而引入新bug；问个问题，回答像教科书一样空洞。别急着怪AI，问题大概率出在提示词上。我踩了无数坑后，总结出3个万能模板，直接复制改参数就行，效果立竿见影。&lt;/p&gt;&lt;h2&gt;模板一：专家咨询型&lt;/h2&gt;&lt;h3&gt;适用场景&lt;/h3&gt;&lt;p&gt;需要深度分析、专业建议、复杂问题拆解。比如：行业趋势分析、产品方案评估、技术选型建议。&lt;/p&gt;&lt;h3&gt;模板结构&lt;/h3&gt;&lt;pre&gt;&lt;code&gt;角色：[具体专家身份，如资深产品经理/10年后端架构师]任务：[核心问题，一句话说清]背景：[提供上下文，如公司规模、现有技术栈、预算等]输出要求：[格式、长度、侧重点]&lt;/code&gt;&lt;/pre&gt;&lt;h3&gt;实战示例&lt;/h3&gt;&lt;p&gt;我最近在选型消息队列，用这个模板问DeepSeek：&lt;/p&gt;&lt;pre&gt;&lt;code&gt;角色：资深后端架构师，有5年高并发系统经验任务：帮我对比Kafka和RabbitMQ，选一个适合我们项目的背景：我们团队10人，Java技术栈，日均消息量约100万，对延迟要求不高，但需要保证消息不丢失输出要求：从性能、可靠性、运维复杂度三个维度对比，给出推荐并说明理由，控制在500字以内&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;结果：AI给出的分析非常到位，对比了吞吐量、数据持久化、集群管理、社区活跃度等细节，最后推荐了Kafka，还给了部署建议。比我自己查资料快10倍。&lt;/p&gt;&lt;h3&gt;参数调整建议&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;角色越具体越好&lt;/strong&gt;：带上年限、领域、甚至公司背景（如&quot;曾在阿里负责双十一大促的架构师&quot;）&lt;/li&gt;&lt;li&gt;&lt;strong&gt;背景信息要足&lt;/strong&gt;：团队规模、技术栈、预算、时间限制等，缺一不可&lt;/li&gt;&lt;li&gt;&lt;strong&gt;输出要求明确&lt;/strong&gt;：字数、格式（表格/列表/段落）、侧重点（如&quot;重点说缺点&quot;）&lt;/li&gt;&lt;/ul&gt;&lt;h2&gt;模板二：写作优化型&lt;/h2&gt;&lt;h3&gt;适用场景&lt;/h3&gt;&lt;p&gt;改写、润色、扩写、总结、换个风格。比如：把技术文档改成大白话、把周报改成述职报告、把英文邮件改成中文。&lt;/p&gt;&lt;h3&gt;模板结构&lt;/h3&gt;&lt;pre&gt;&lt;code&gt;原文：[粘贴原文]目标风格：[如专业/幽默/简洁/正式]修改要求：[具体修改点，如删掉废话、增加数据、调整语气]额外约束：[如字数限制、禁止使用某些词]&lt;/code&gt;&lt;/pre&gt;&lt;h3&gt;实战示例&lt;/h3&gt;&lt;p&gt;我写了一篇技术博客初稿，太啰嗦，让ChatGPT帮我改：&lt;/p&gt;&lt;pre&gt;&lt;code&gt;原文：我们在开发过程中发现，使用微服务架构虽然有很多好处，但是也带来了一些挑战，比如服务间的通信变得复杂了，而且部署和监控也需要更多的工具和人力。目标风格：简洁、技术向修改要求：删掉所有废话，每句话都要有信息量，保留技术细节，去掉&quot;我们&quot;&quot;但是&quot;这类词额外约束：控制在200字以内&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;结果：AI把原文压缩成150字，保留了&quot;服务间通信复杂度增加&quot;&quot;需要引入服务网格&quot;&quot;部署成本上升&quot;等干货，读起来像资深工程师写的技术笔记。我直接用了。&lt;/p&gt;&lt;h3&gt;参数调整建议&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;目标风格要具体&lt;/strong&gt;：不要只说&quot;写好一点&quot;，而是&quot;像鲁迅一样犀利&quot;或&quot;像科技媒体一样客观&quot;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;修改要求可量化&lt;/strong&gt;：比如&quot;每段不超过3句话&quot;&quot;删除所有形容词&quot;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;额外约束防跑偏&lt;/strong&gt;：比如&quot;不要使用比喻&quot;&quot;禁止出现第一人称&quot;&lt;/li&gt;&lt;/ul&gt;&lt;h2&gt;模板三：代码调试型&lt;/h2&gt;&lt;h3&gt;适用场景&lt;/h3&gt;&lt;p&gt;找bug、优化性能、重构代码、解释代码逻辑。适合程序员。&lt;/p&gt;&lt;h3&gt;模板结构&lt;/h3&gt;&lt;pre&gt;&lt;code&gt;任务：[调试/优化/解释]代码语言：[Python/JavaScript等]代码：[粘贴代码]问题描述：[报错信息/预期行为/实际行为]环境信息：[Python版本、操作系统、依赖库版本等]输出要求：[如只给出修改后的代码、或给出解释和代码]&lt;/code&gt;&lt;/pre&gt;&lt;h3&gt;实战示例&lt;/h3&gt;&lt;p&gt;我用Python写了一个爬虫，但总是超时，让DeepSeek帮我优化：&lt;/p&gt;&lt;pre&gt;&lt;code&gt;任务：优化代码语言：Python代码：import requests
url = &quot;https://example.com&quot;
response = requests.get(url)
print(response.text)问题描述：当网站响应慢时，程序会卡住很久，希望设置超时并重试环境信息：Python 3.9, requests 2.28, Windows 10输出要求：给出修改后的完整代码，并解释修改点&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;结果：AI给出了带超时和重试的代码：&lt;/p&gt;&lt;pre&gt;&lt;code&gt;import requests
from requests.adapters import HTTPAdapter
from requests.packages.urllib3.util.retry import Retry

session = requests.Session()
retry = Retry(total=3, backoff_factor=1, status_forcelist=[500, 502, 503, 504])
adapter = HTTPAdapter(max_retries=retry)
session.mount('http://', adapter)
session.mount('https://', adapter)

try:
    response = session.get('https://example.com', timeout=5)
    print(response.text)
except requests.exceptions.RequestException as e:
    print(f&quot;请求失败: {e}&quot;)&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;并解释了Retry和Session的用法。直接复制运行，完美解决。&lt;/p&gt;&lt;h3&gt;参数调整建议&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;问题描述要精确&lt;/strong&gt;：贴出完整报错信息，或描述&quot;当输入X时，期望Y，实际得到Z&quot;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;环境信息不能省&lt;/strong&gt;：版本差异会导致bug，尤其是Python和JavaScript&lt;/li&gt;&lt;li&gt;&lt;strong&gt;输出要求控制细节&lt;/strong&gt;：如果只要代码，就说&quot;只输出代码，不要解释&quot;；如果只要解释，就说&quot;只解释逻辑，不需要代码&quot;&lt;/li&gt;&lt;/ul&gt;&lt;h2&gt;总结&lt;/h2&gt;&lt;p&gt;这三个模板是我日常高频使用的，覆盖了咨询、写作、编码三大场景。核心思路就是：给AI足够的信息和约束，它才能精准输出。下次用AI之前，先套个模板，效果绝对让你惊喜。快去试试吧，有更好用的模板欢迎留言交流。&lt;/p&gt;</description><pubDate>Fri, 17 Jul 2026 15:57:05 +0800</pubDate></item><item><title>用AI智能体自动整理笔记和知识库，再也不怕遗忘</title><link>http://298.name/post/207.html</link><description>&lt;h2&gt;为什么需要AI整理笔记？&lt;/h2&gt;&lt;p&gt;我承认，我是个笔记囤积狂。从Notion到Obsidian，从Markdown到PDF，攒了上千条笔记，但真正回顾的不到10%。直到我用AI智能体批量处理，才让这些&quot;死&quot;笔记活了过来。&lt;/p&gt;&lt;h2&gt;效果先看&lt;/h2&gt;&lt;p&gt;运行一次脚本后：&lt;/p&gt;&lt;ul&gt;&lt;li&gt;每篇笔记自动获得3-5个标签（如#AI、#效率工具）&lt;/li&gt;&lt;li&gt;自动生成50字以内的摘要&lt;/li&gt;&lt;li&gt;发现&quot;Python&quot;和&quot;数据分析&quot;笔记之间的关联，自动添加双向链接&lt;/li&gt;&lt;/ul&gt;&lt;h2&gt;你需要准备什么&lt;/h2&gt;&lt;ul&gt;&lt;li&gt;Obsidian（或其他本地Markdown编辑器）&lt;/li&gt;&lt;li&gt;OpenAI API Key（或兼容API）&lt;/li&gt;&lt;li&gt;Python 3.8+&lt;/li&gt;&lt;li&gt;一点点耐心&lt;/li&gt;&lt;/ul&gt;&lt;h2&gt;操作步骤&lt;/h2&gt;&lt;h3&gt;1. 安装依赖&lt;/h3&gt;&lt;pre&gt;&lt;code&gt;pip install openai pandas tiktoken&lt;/code&gt;&lt;/pre&gt;&lt;h3&gt;2. 配置API&lt;/h3&gt;&lt;p&gt;在环境变量中设置：&lt;/p&gt;&lt;pre&gt;&lt;code&gt;export OPENAI_API_KEY='你的key'&lt;/code&gt;&lt;/pre&gt;&lt;h3&gt;3. 脚本核心逻辑&lt;/h3&gt;&lt;p&gt;我写了一个Python脚本，遍历Obsidian仓库下的所有Markdown文件，调用GPT-3.5-turbo进行批量处理。&lt;/p&gt;&lt;pre&gt;&lt;code&gt;import os
import openai
from pathlib import Path

openai.api_key = os.getenv('OPENAI_API_KEY')

def process_note(file_path):
    with open(file_path, 'r', encoding='utf-8') as f:
        content = f.read()
    
    prompt = f&quot;&quot;&quot;分析以下笔记，输出JSON格式：
{{
  &quot;tags&quot;: [&quot;标签1&quot;, &quot;标签2&quot;],
  &quot;summary&quot;: &quot;一句话摘要&quot;,
  &quot;related_terms&quot;: [&quot;关联词1&quot;, &quot;关联词2&quot;]
}}

笔记内容：
{content[:2000]}&quot;&quot;&quot;
    
    response = openai.ChatCompletion.create(
        model='gpt-3.5-turbo',
        messages=[{'role': 'user', 'content': prompt}],
        temperature=0.3
    )
    return response.choices[0].message.content

# 遍历笔记目录
notes_dir = Path('/path/to/your/vault')
for md_file in notes_dir.rglob('*.md'):
    result = process_note(md_file)
    # 将结果写入笔记的frontmatter或单独文件
    print(f'Processed: {md_file.name}')&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;注意：OpenAI有速率限制，建议加time.sleep(1)避免超限。&lt;/p&gt;&lt;h3&gt;4. 将结果写回笔记&lt;/h3&gt;&lt;p&gt;我选择将标签和摘要写入笔记的YAML frontmatter：&lt;/p&gt;&lt;pre&gt;&lt;code&gt;---
tags: [AI, 自动化]
summary: 用AI自动整理笔记的方法
---
&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;脚本解析GPT返回的JSON，然后更新文件头部。&lt;/p&gt;&lt;h3&gt;5. 建立关联&lt;/h3&gt;&lt;p&gt;更高级的玩法：用GPT提取每篇笔记的关键实体，然后在Obsidian中自动添加[[双向链接]]。我写了一个小插件思路：&lt;/p&gt;&lt;ul&gt;&lt;li&gt;用spaCy或GPT提取实体（如&quot;Python&quot;、&quot;机器学习&quot;）&lt;/li&gt;&lt;li&gt;在笔记中搜索这些实体，如果其他笔记标题包含，则添加链接&lt;/li&gt;&lt;/ul&gt;&lt;h2&gt;进阶技巧&lt;/h2&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;批量处理速度&lt;/strong&gt;：用异步请求或本地模型（如llama.cpp）可大幅提速&lt;/li&gt;&lt;li&gt;&lt;strong&gt;隐私优先&lt;/strong&gt;：敏感笔记用本地模型，比如Ollama+Llama3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;定期运行&lt;/strong&gt;：设置cron job每周自动跑一次&lt;/li&gt;&lt;/ul&gt;&lt;h2&gt;注意事项&lt;/h2&gt;&lt;ul&gt;&lt;li&gt;API费用：每篇笔记约0.01元，1000篇也就10块钱，划算&lt;/li&gt;&lt;li&gt;不要一次性处理太多，分批次避免报错&lt;/li&gt;&lt;li&gt;建议先在小范围测试，比如一个子文件夹&lt;/li&gt;&lt;/ul&gt;&lt;h2&gt;总结&lt;/h2&gt;&lt;p&gt;AI智能体不是替代你思考，而是帮你把散落的知识点串起来。现在我的Obsidian笔记库每天都自动更新标签和摘要，回顾时直接搜索标签或关键词，效率提升至少5倍。你也试试？&lt;/p&gt;</description><pubDate>Fri, 17 Jul 2026 10:00:24 +0800</pubDate></item></channel></rss>