一、项目概述
「眸间行迹」是一套依托 AR 智能穿戴眼镜搭建的轻量化文旅智能处理系统,采用低代码可视化流程编排方案,无需复杂后端开发即可实现以下一体化出行辅助能力:
- ✅ 实景打卡盖章 - 现场拍摄并叠加国风印章
- ✅ 外文实时翻译 - 识别画面文字并叠加译文
- ✅ 景点 AI 讲解 - 基于场景生成精简人文介绍
- ✅ 天气查询 - 结合地理位置提供气象信息
- ✅ Q 版纪念插画生成 - 根据实景生成手绘风格插画
- ✅ 行程归档 - 结构化保存出行记录
系统以用户语音/文本指令作为触发入口,结合图像视觉大模型、文本大模型、地理信息解析组件构建完整自动化 Workflow,适配户外旅游、城市漫步、展馆游览等多类出行场景。
核心价值:解决传统出行频繁低头使用手机、记录繁琐、信息获取碎片化的痛点,真正实现抬头交互、所见即所得的穿戴式智能体验。
二、整体工作流架构与流程逻辑
本项目整体流程分为外部图片直入分支与用户意图交互分支两大入口,全流程节点串联清晰,容错性与可拓展性较强。
2.1 入口分支判断
流程最前端设置条件分支组件,判定输入参数中图片 URL 是否非空:
| 分支 | 条件 | 处理流程 |
|---|---|---|
| 分支一 | 已有图片资源(传入外部图片链接) | 直接送入 VL 视觉大模型进行画面处理,跳过拍摄与意图识别环节,支持批量图片批量打卡处理 |
| 分支二 | 无外部图片 | 进入核心意图识别模块,解析用户输入指令语义,匹配对应功能链路 |
2.2 意图识别核心分发逻辑
意图识别模块作为整个智能体的调度中枢,对用户输入文本进行分类匹配,共划分 5 类核心业务意图与兜底无效意图:
- 打卡类意图:执行眼镜现场取景拍摄,完成国风印章叠加、文案存档
- 翻译类意图:调用实景画面识别画面内外文,在原图对应位置叠加中文译文
- 讲解类意图:基于拍摄画面识别场景,由大模型生成精简景点人文介绍
- 天气类意图:读取设备上传的经纬度坐标,调用地理解析接口反译地址并查询当地气象信息,输出穿衣与出行建议
- 兜底其他意图:未命中以上需求时直接终止流程,避免无效调用模型与拍摄硬件资源
2.3 多模块并行数据处理链路
当意图判定需要调用眼镜拍摄后,系统启动多线程并行处理多条业务链路,各分支独立运算最终汇总至结束节点:
| 处理链路 | 核心功能 | 输出结果 |
|---|---|---|
| 视觉处理链路 | VL 视觉大模型接收实景照片,完成朱砂国风篆刻印章添加、外文文字翻译图层叠加 | 经过美化标注后的实景图片 |
| 文本内容链路 | 文本大模型结合画面内容、地理位置、时间参数,生成景点介绍文案、文艺打卡短句;天气分支联动经纬度转 POI 组件,解析当前地址并调取气象数据 | 景点介绍文案 + 天气出行提示 |
| 创意生成链路 | 图像生成大模型依据实拍原图,生成 Q 版手绘风纪念插画,再通过图片编码组件将图像转为 Base64 格式 | Base64 编码的纪念插画,便于云端存储与多端传输 |
| 数据预处理链路 | 两处文本处理字符串组件对用户原始输入、模型返回结果做清洗、精简、格式规整 | 统一输出格式,防止参数传递报错 |
2.4 流程收尾与数据归档
所有并行分支全部执行完毕后统一汇入结束汇总节点,整合以下多维数据:
- 📸 处理后图片
- 🎨 插画素材
- 📝 文字介绍
- 📍 打卡定位
- 🌤️ 天气信息
- ⏰ 操作时间
打包生成单条结构化行程存档记录,可推送至 AR 眼镜端进行弹窗文字 + 语音播报展示,同时支持存入全局变量数组,为后续一键生成完整旅行游记提供历史数据源。
三、核心功能模块技术实现说明
3.1 实景视觉增强(VL 视觉大模型)
视觉模型核心 Prompt 固定两套能力:
- 印章叠加:在画面右下角叠加半透明带宣纸晕染质感的「镜游留痕」竖向篆刻印章
- 文字翻译:自动识别画面标牌、菜单、导览牌中外语文本,将译文贴合原文位置悬浮覆盖
设计原则:原图基础景物完全保留不做篡改,仅新增双层标注图层,兼顾打卡仪式感与文字翻译实用需求。
3.2 自然语言生成与意图调度
- 意图识别:采用 Prompt 驱动式分类判定,无需训练微调,依靠提示词规则即可区分用户需求
- 文本生成:文本大模型针对景点介绍做字数约束,输出内容适配 AR 眼镜窄屏阅读与语音朗读,规避长文本冗余信息
- 天气模块:依托经纬度逆地理编码技术,将坐标转换为具体省市地标后调取气象数据,让位置与天气信息精准绑定
3.3 轻量化图像生成与编码适配
图像生成分支不依赖本地算力,云端大模型根据实拍场景结构生成卡通化纪念图,再通过 URL 转 Base64 插件完成图片二进制转码,解决网页端、穿戴设备端图片跨域访问、文件存储不便的问题,降低项目部署与数据存储门槛。
3.4 低代码可视化编排优势
整套业务逻辑完全在平台可视化画布拖拽搭建,无原生代码开发,节点可灵活增删拓展:
可扩展功能示例:
- 距离测算
- 路线规划
- 隐藏解谜印章
- 多轮对话交互
场景迁移能力:
- 工业巡检
- 设备识图
- 校园导览
- 其他穿戴设备应用场景
核心优势:仅需新增分支与对应插件即可完成迭代,具备极强的二次开发与场景迁移能力。
四、应用价值与场景落地
用户体验层面
将导航、翻译、记录、查询多项手机高频功能迁移至 AR 眼镜端,行走途中无需低头查看电子设备,提升出行安全性与沉浸感。
项目落地层面
低代码架构大幅缩短智能穿戴应用开发周期,适合大学生创新创业项目、课程设计、穿戴设备配套小程序快速原型开发。
数据沉淀层面
每一次打卡行为都会留存 图文 + 定位 + 时间 + 天气 多维数据,可聚合生成个人旅行数字相册,打造轻量化个人文旅数字藏品记录体系。
五、总结
「眸间行迹」以 AR 眼镜硬件为载体,结合多模态大模型与可视化流程编排技术,构建了一套开箱即用、易拓展、易部署的穿戴式文旅智能工作流。
完整闭环流程:
- 指令识别 - 语音/文本输入
- 实景采集 - AR 眼镜拍摄
- 多模态内容生成 - 视觉增强、文本生成、图像创作
- 数据归档 - 结构化存储与展示
双重价值体现:
- 实用价值:满足普通游客游览记录、信息查阅的刚需
- 情感价值:依托国风印章插画设计赋予出行留念独特的仪式感
最终目标:为 AR 智能眼镜 C 端生活化应用提供了简洁可行的落地方案。
转载自 CSDN-专业IT技术社区
原文链接:https://blog.csdn.net/qq_45030271/article/details/162849690



