洛洛的第18篇原创文章

大家好,我是洛洛。
最近大模型那么多,到底哪个更适合普通白领呢?
今天我们就拿白领最常遇到的读文档、核对数据、做活动页面这些场景来测试一下。
这些场景大模型表现如何,光看跑分根本选不出来。我们直接拿我一个做营销的朋友的真活儿上手,把 MiniMax M3、DeepSeek V4 Pro、Kimi 2.7、Gemini 3.5 Flash 摆到一起各跑一遍。
看看这种典型的办公室白领的工作,哪个模型更能打?

案例实测
朋友有个咖啡品牌叫山野咖啡,主打云南保山产地豆和冷萃工艺,走的是产地故事加质价比路线,价位卡在瑞幸和星巴克中间。最近她要做一个活动营销方案,并且需要看到活动落地页的效果,我们一步一步走完这个流程。
第一步:读参考资料出方案
朋友给我了这个项目的参考资料,2 张友商活动页长截图,另外还有一份15万字188页的山野咖啡产品文档及用户访谈摘录(脱敏)。

这些资料靠人一条条看完再提炼,半天时间就没了。我想看看模型能不能读懂复杂的长图和这15万字的文档,还能根据这些资料,直接给出一版能用的活动页方案。
我直接在4个模型中都输入同样的内容:

DeepSeek V4 Pro
DeepSeek可以同时处理截图和长文档,产出的方案也精准兼顾了高级调性与硬核卖点,用低饱和视觉与情绪文案维持品牌审美,用18.8元定价、0糖0脂、科学工艺及空瓶回收玩法,直击用户痛点并巧妙促成高裂变与高复购。

DeepSeek可以坦率地承认自己有读不出来的地方,主要是一些小字,细则。整体来说表现还是不错的。

Kimi 2.7
Kimi 长文本是老本行,在长文本阅读上还是非常强的。整个方案基于50条真实用户访谈,避开瑞幸低价与星巴克社交,以产地情绪加慢工艺错位竞争,用硬核数据建立信任,让促销不损调性。

对于读不清楚的地方,Kimi 2.7很诚实,写得也相对比较清楚。读不清的地方和DeepSeek差不多,主要是一些小字。

MiniMax M3
M3是唯一一个给我输出了完整文档供我下载的,它这个方案的完整程度,是可以直接交给老板看的程度了。方案内容也不错,差异化清晰,用的产地心智战。每条决策都有访谈原话兜底,SKU 只推 3 款很克制,是真的懂营销。

关于长截图,MiniMax M3很诚实地告诉我它只能读清80%,哪些是读不清楚的,什么原因造成的,都列得清清楚楚。其实我不怕大模型读不清,就怕它读不清还瞎编。这一点MiniMax M3确实做得不错。

Gemini 3.5 Flash
Gemini 3.5 Flash 主打快和多模态,作为海外参照,图文理解的综合精度、中文文档和咖啡用户反馈把握得也比较准确,速度也确实更快。方案精准兼顾了高级调性与硬核卖点,整体表现还是不错的。

Gemini 3.5 Flash对于对不清的地方就写得相对比较笼统了。也没有一个大致的能读清的比重,我就不好一下子非常直观地知道它到底懂读了多少。

读1M长文本和识别长截图再生成活动方案这个步骤,4个模型整体变现都不错。DeepSeek V4 Pro能完成任务,整体表现中规中矩,Gemini 3.5 Flash胜在生成的速度更快,Kimi 2.7对长文本的把握会更准确一些,MiniMax M3生成的方案更完整可以直接交付,对读不清楚的截图内容的描述也更加准确和细致。
第二步:核实活动页面核心数据
方案里准备在页面引一句给品牌背书的市场数据,草稿写的是中国咖啡市场即将破万亿。我需要核对这个说法到底准不准确。
数据不对,活动页轻则被同行挑刺,重则涉嫌虚假宣传。
提示词:
我的活动页方案里准备引一句中国咖啡市场即将突破万亿。请帮我核对,第一,万亿口径说的是整个咖啡行业还是现磨咖啡,最新可查的市场规模数字大概是多少、来源和年份是什么;第二,作为体量参照,拉一下星巴克最近一个财年的营收和当前市值;第三,给页面一句更严谨、不会被挑刺的表述建议。
DeepSeek V4 Pro
DeepSeek虽然没有接入专门的行业数据库,但是给出的答案还是靠谱的,而且还很贴心地给出了三种表述建议。

Kimi 2.7
Kimi查到了“万亿”口径的来源,也指出这种表达可能面临的风险,专业性还是不错的。

MiniMax M3
MiniMax 网页端推出金融模块,我们这个case正好可以试一下。

在对话框点击“+”,选择已连接插件,再选择金融数据库即可。

走 Agent 金融模块能直接连库取实时行情,星巴克的美股营收和市值能即时拉到,数据时效是最大优势。

MiniMax M3是唯一一个帮我验证了数据信源的,这一点确实让我心里更踏实一些。
Gemini 3.5 Flash
Gemini 3.5 Flash 在这个问题上的生成速度同样是最快的,生成的结果也可以用。

这一轮从给出的答案是否正确上,各家模型拉不开差距,从生生速度上Gemini 3.5 Flash更快,更占优势。不过从信源可信度上,MiniMax M3会更好一些。
第三步:把方案和核准的数据变成落地页
这一步我目标就是让各个模型自由发挥。
提示词:
根据前面定下的「山野冷萃」活动页方案,用单个 HTML 文件做一版活动落地页。
DeepSeek V4 Pro
看一下DeepSeek V4 Pro自由发挥的结果,只能说中规中矩,这个水平的前端页面,半年之前的模型其实也可以达到。
Kimi 2.7
Kimi 2.7生成的速度是真慢啊,不过这个页面的效果很好,不管是配色还是交互都非常高级,按钮和文字排版这些细节也处理得很到位,是可以直接拿去上线的程度。
MiniMax M3
这一轮M3的生成速度也比较慢,但是整体效果很不错,山野自然风的版式很好看、还有3D效果、领券按钮和好评轮播的交互也很顺,整体配色也很有高级感。
Gemini 3.5 Flash
Gemini 3.5 Flash 前端出活儿快,不过第一版打开竟然还是代码。

好不容易打开页面之后发现,还不如不打开。这根本不是一个可以落地的活动页。

各家模型真正拉开差距的是在落地页生成这一步,出页面比的是审美加完成度,能少返工、不用再补配色的产出最省心。Kimi 2.7和 MiniMax M3 在国产里靠前,这两个都是能直接上线的水准。

洛洛有话说
三个 case 跑完,我还挺意外的。读1M长文本、认长图、核对数据,几家基本拉不开差距,能力都到位了。可一旦放开手让几家自由发挥生成活动落地页,差距一下就拉开了。
DeepSeek V4 Pro 像稳定发挥的中等生,该有的都有,少了点让人眼前一亮的地方。Kimi 2.7 的网页生成是真的惊喜,高级感很强,出来就能直接用。MiniMax M3 同样可圈可点,核数据时连着金融数据库,几家结论虽然一致, M3 还附上了可靠信源,可信度一下就上去了,前端的 3D 视差和滚动动效也做得到位。Kimi 和 M3 都偏慢,但慢得值,生成的页面基本直接能上线。Gemini 3.5 Flash 速度最快,可惜出的页面一开始打不开,好不容易打开也不像个落地页,快归快,用不上。

四个顶流横评下来,哪个更适合办公室白领?其实还是看各自具体的场景,不过从读文档、核数据、页面生成以及组合着用最省,返工最少的角度,Kimi2.7和MiniMax M3都是不错的选择。
如果你的工作对数据准确性要求特别高的话,MiniMax M3可能会更适合一些。
好咖啡讲究产地溯源,好模型也一样,能交出结果、还交代得清来路的,才真正让人放心。
测评结果各位读者老师体验一致吗?评论区聊聊~
往期推荐:
AI 看得越多越焦虑?6 本书 + 3 门课,帮你把认知一次补齐
马斯克、哈萨比斯都绕不开的15部AI影片,看完聊AI不再外行(建议收藏)