微信扫码
添加专属顾问
我要投稿
图片识别
今天同事丢给我一张图片格式的思维导图,让我参考思维导图的结构写一个大模型的建设方案,但这张图有些内容不符合我们的实际,需要对这张图做一些修改,可是没有源文件。于是想到了上一篇文章中的方法,把图片丢给GPT-4o,让它给识别并生成markdown格式的文本,然后利用Xmind进行自动生成。
整体还是比较准确的,如下图所示:
读规划图
识别效果挺好,还做了结构化提取。
猜谜语
老婆逛商场时,看到中国黄金在做一个看图猜谜语的活动,于是发给我让我猜。
还是想到了GPT-4o。。。于是丢给它
这是他的分析结果,对不对不知道,反正看起来挺有道理的,我是一个没猜出来。有谁知道吗,可以评论区留个言~
以上都是利用大模型的视觉能力,相当于有了眼睛。
AI写作
前段时间又接到一个任务,写一个大模型应用场景设计思路,整体听下来又是拍脑袋的活儿,没啥意思。按照宝玉老师的分类,普通人日常的写作分三种:日常沟通、公文和创作。公文类就是各种报告、总结、文档等等,这种公文套话多,格式固定,但是费时费力,现在绝大部分公文都可以用 AI 帮助协作了。
这个设计思路也属于这种公文类。还是老套路,整理好提示词,反复尝试几次,同时丢给不同的大模型。
通义的回答:
基于上面的改一改基本就能用了。
几点思考
随着大语言模型逐步像多模态大模型转变,模型拥有更多模态的能力,应用场景会越来越多。
目前AI写作、AI数据分析还是存在局限性,普通人要想用好AI写作,必须结合自己的数据,靠丢几篇文章和提示词很难让大模型写出比较好的效果。比如我毕业这么多年,电脑产生了这么多文件,但这些文件又不方便上传到联网的大模型,如果这个时候我的电脑或手机本地部署了大模型,能直接访问这些文件,把我的整个电脑变成一个知识库,这个知识库随着我的使用,不断更新,成为我的第二大脑,在使用写作类似功能时,部署在本地的大模型可以直接读取我本地的文件,这样大模型写的内容就会像我本人写的,同时又不上传到互联网大厂服务器上。
像Notion这种笔记软件已经有了AI写作功能,但只能访问笔记内的数据,如果能从操作系统层面直接访问本地文件是最好的。由于硬件的限制,现在AI PC部署的大模型能力有限,好消息是小参数量的大模型能力越来越强了,苹果等公司也做了一些探索。AI PC和AI智能手机应该能激发一波购买需求~
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费场景POC验证,效果验证后签署服务协议。零风险落地应用大模型,已交付160+中大型企业
2025-05-27
Dolphin-API:字节Dolphin多模态文档解析模型API化全攻略
2025-05-26
本地AI对话神奇,ChatWise到底有什么用?
2025-05-25
从BGE到 CLIP,从文本到多模态,Embedding 模型选型终极指南
2025-05-25
AI Agent到底哪家强?横评五款主流Agent
2025-05-24
AI Agent协议A2A交互细节详解
2025-05-23
技术思考:小尺寸+两阶段式多模态文档解析模型Dolphin思路评析及PP-OCRv5更新
2025-05-22
Alivia VLM:企业级视觉智能体在门店场景落地实战
2025-05-21
Gemini接管搜索、全家桶秒变通用Agent ,以及Google Glass is so back!|直击Google I/O
2024-09-12
2024-06-14
2024-06-17
2024-08-06
2024-08-30
2024-05-30
2024-11-28
2024-10-07
2024-10-16
2024-04-21