标签归档:Gemini

五聊AI工具:与AI共舞

前面写了好几篇聊 AI 工具的文章,分享了一些 what 和 how,包括 AI 是什么、有哪些好用的 AI 产品和使用技巧。如果做个简单总结,就是高频对话,输入、决策和输出都过一遍 AI 助手,产品层面推荐沉浸式翻译、Typeless(豆包输入法、微信输入法等)、豆包(语音>打字)、Gemini(以及 Google AI 概览)、小红书问一问(限移动端)、抖音 AI 解析 & AI 搜索,当然这是对非研发,研发同学 Codex 等还是要用起来的。本篇想聊聊更深层次的内容,如何与 AI 共舞。

## 态度

对于 AI 的能力,现在的情况是一部分人低估而另一部分人高估。前者的问题是认知和行为惯性,对于工具,我们应该关注其优点,而非只盯着不足,盯着不足除了获得一些虚幻的优越感,并不能给我们带来进步,世界本就不完美,也 “没有银弹”,而我们要前进。后者的问题是 FOMO(Fear Of Missing Out),其实只要自己持续在用且有总结就 OK,有个现代笑话:你和朋友们去森林里徒步,遇到一只熊,不用怕,赶紧系鞋带,比最后一个小伙伴跑得快就行。

关于 AI 和人的关系,“AI 的一切推理是基于过往数据的条件概率”,所以它对未来的预测是相对弱的,同时如果你赞同 “预测未来最好的方法就是去创造它”,那么人对未来的预测就是相对强的,同时对于个体、组织而言,一方面 AI 能给出方向,但很难给出具体目标(做什么),因为各人情况各不相同,有些数据还没发布到网上,AI 无从抓取,另一方面对于解决方案(怎么做),同样由于部分数据不在公域,所以 AI 提供的解决方案只是参考,即使大概率已超过我们,也需要我们去补充、完善并决策。对待 AI 应该像早些年的搜索,“君子生非异也,善假于物也”。

## 行为

对于幻觉(说瞎话),暂时没法规避,“大模型依托概率生成内容是固有运行机制”,RAG 也只是一定程度上降低幻觉,我们要做的是持续保持质疑,具体应对方式包括:第一,给 AI 增加(记忆)指令:“回答问题时要核对权威数据”,效果薛定谔,至少目前豆包仍存在很大的问题,且当安慰剂;第二,抓大放小,个别细节问题如果调教后仍反复出现但不影响重点内容,接受现状;第三,二次确认,这是核心,包括但不限于反问、换用其他 AI、搜索百科等。

关于隐私,之前有国内公司的负责人说,“中国人对隐私问题的态度更开放,也相对来说没那么敏感”,话虽如此,但随着使用的深入,我们也确实需要注意下,因为数据一旦出去了,多少人能经手看到就不知道了,作为用户,其实就一点,特别机密的内容不要和 AI 讨论,同时如果确实需要讨论,可以进行局部讨论而不涉及完整内容,进行思路探讨而不涉及具体方案。

四聊AI工具

## 背景

之前提到要拥抱 AI,先说结论,各种问问题,换句话说,任何问题都可以看下 AI 的意见,具体操作层面,所有输入、决策、输出都过一遍 AI 助手。

## 技巧

首先,移动端豆包,网页端 Gemini,DeepSeek 作为两端的替补。如果还想体验 GPT 等,试试 DeepSider,每天都有免费额度。对于 AI 助手的使用,可以保持这样的态度:有问题 AI 一下,即使当前 AI 的回答未必能完全解决问题。另外,AI 助手的使用门槛在于习惯的改变和提问的门槛,而且很多时候问题比答案更重要。

其次,聊聊各个 AI 助手的使用心得:豆包,语音识别效率高(甚至单独出了个豆包输入法,同时近期也知道了背后的一个重要原因是 “他们奔赴全国各地采集方言,口音的颗粒度细化到了城市内部的区县级”),交互细节完善比如点击可修正问题、双击回答也能很方便地复制或追问,总之输入的便捷性使得豆包相对通用。

关于豆包的使用场景:移动端,一是语音提问,取代百度、Google 等传统搜索;二是识物,通过豆包的打电话功能,摄像头对准物品让豆包回答,这比传统搜索先转换成文字描述或者先拍照再搜索都要方便,识别准确率也还不错;三是辅助背单词,直接语音发问,回答内容长度还行,不过由于一些单词出现过事实性错误,可以给豆包增加(记忆)指令:“回答问题时要核对权威数据”;四是辅助创作,博客写完后发布前,让豆包对着屏幕念一遍,然后视情况探讨、修改内容。

网页端,安装豆包浏览器插件,总结文章和进行其他文字性提问,后者的需求背景包括:一是有时不方便语音提问;二是有些疑问是基于当前网页中的内容的,再拿手机提问没那么方便,毕竟目前还要解锁手机打开豆包,期待 Gemini 版 Chrome 和 Apple Intelligence 的全面开放。

Gemini,排除可用性(访问、付费等门槛)这部分不说,个人感觉事实核查 (Fact-Check)、上下文关联能力很强,连续发问时后续问题的回答会考虑前面的对话内容,这点在要求输出结果是表格时很有必要,既保证了回答风格是我们想要的,同时可以持续优化表格而不用手动修改。虽然 Gemini 也出现过 “为追求行文简洁而误删内容” 的情况,此时直接反馈不要遗漏内容,它在更正的同时会记录到 Instructions for Gemini(类似豆包的记忆功能)中,当然我们也可以提前新增指令。

关于 Gemini 的使用场景:一是文字提问;二是辅助创作,博客发布前让 Gemini 过一遍,问 “还有什么可补充完善的吗”,然后视情况修改,至于是否修改、改多少看当时的心情,毕竟这里存在一个理念问题:如果全按 AI 助手的建议改,人的价值、主体性在哪里,是否有缺陷才是人类,才是自己?

DeepSeek,也是因为话多,比较适合探讨一些开放性问题,更容易有新启发,最近移动端也增加了语音功能,虽然准确率比不上豆包但至少可用了,提问的硬性门槛降低不少,更方便讨论一些相对复杂点的探索向的内容。

关于 Gemini、DeepSeek 网页版的使用,为了避免左侧对话列表过长,可以设定几个主题,然后不同问题只在特定主题里讨论,省得一直 “开启新对话” 然后左侧一堆对话记录。另外,Gemini 用户可以试试 Voyager,完善了 Gemini 网页版的很多交互体验。由于目前 AI 助手还处于一个百家争鸣的状态,为方便多 AI 搜索,一个剪切板管理工具很有必要,微信输入法用户直接用它的剪切板功能即可,非微信输入法用户可能需要专门的工具比如 Paste 等,同时,由于在电脑前主用 Gemini,因此部分常用提示词记在 Voyager 里,暂时没有使用笔记工具记录。

至于其他 AI 助手,百度文心(叫小度不是更好嘛),偶尔(已经慢慢可以这么说了)百度时用用;阿里千问,再有免单活动再下载;腾讯元宝,也是一样,当然微信浏览器上的总结公众号文章功能挺好,竞争就是这么残酷,你必须有比别人强的地方。

关于输入的提示词建议,社媒上的可以了解但不一定用,AI 助手初期也许没那么 “智能”,但这是一个逐步改善的过程,从产品设计角度来说,更好的解决方案是通过和用户的持续对话,识别并理解用户,然后输出内容时自带角色、偏好等。

最后如果只有一个使用建议,那就是持续给反馈,包括为什么删掉 X、改为 Y 如何等,在这个过程中大概率会触发 AI 助手的相关功能和能力边界。如果再加一个建议,那就是问 AI 助手有哪些技巧,其中 “设定角色”(比如作为资深产品经理请回答某某问题)还不错,当然对回答内容有时要做二次确认,同时持续保持质疑。

## P.s.

写这篇文章的过程中看到有网友说 AI 助手不会成为新时代的入口,我的看法恰恰相反,AI 助手一定程度上是传统搜索的升级版,不管输入还是输出,想想早期的百度一下你就知道到(后来没能更进一步的)百度一下你就得到,对比现在 ChatGPT、豆包的语音输入总结输出、Manus 的任务执行,可以看到 AI 助手的体验优势,当然 AI 助手的幻觉是一个长期存在的问题,但我们可以通过给它加 “核对权威数据” 等技术约束条件、提供信息来源等产品功能来降低影响,而且换过来想,传统搜索搜到的东西也不一定正确且完整,最后,粗暴的结论是,考虑 ChatGPT、Gemini、豆包等亿级的用户量和潜在的功能扩展,怎么不算入口呢?