OpenClaw会议纪要神器:Qwen3-VL:30B转录飞书语音与截图
OpenClaw会议纪要神器:Qwen3-VL:30B转录飞书语音与截图
1. 为什么需要自动化会议纪要
每周三下午的团队周会是我最头疼的时刻。作为项目负责人,我需要同时记录会议要点、整理行动项,并在会后2小时内将纪要发送给所有相关成员。最痛苦的是,飞书妙记虽然能生成文字稿,但需要手动筛选关键信息;而PPT截图中的关键数据,还得逐张复制到文档中。
直到上个月,我在调试OpenClaw对接Qwen3-VL多模态模型时,突然想到:既然这个30B参数的模型能同时处理图像和文本,为什么不把它变成我的"会议秘书"?经过三周的迭代,现在我的会议纪要流程已经实现80%自动化。以下是具体实现方法。
2. 技术方案设计
2.1 核心组件选型
整个系统由三个关键部分组成:
- 飞书妙记API:获取会议音频转录文本
- Qwen3-VL:30B多模态模型:解析文字稿和PPT截图
- OpenClaw自动化框架:串联流程并发送最终纪要
选择Qwen3-VL:30B是因为它在中文场景下的独特优势。测试发现,对于技术会议中常见的英文术语混用情况(如"这个KPI需要align一下Q3的OKR"),其识别准确率比同等规模的纯文本模型高约15%。
2.2 工作流设计
典型的自动化处理流程如下:
- 会议结束后,OpenClaw自动从飞书获取妙记文字稿和会议截图
- Qwen3-VL模型同时处理文本和图像:
- 从文字稿提取关键决策点
- 从PPT截图识别数据图表和行动计划
- 生成Markdown格式的结构化纪要
- 通过飞书机器人@相关责任人确认
3. 具体实现步骤
3.1 环境准备
首先需要在星图平台部署Qwen3-VL:30B模型。这里有个小技巧:选择"带OpenClaw插件"的镜像版本,可以省去后续的兼容性调试:
# 星图平台部署命令示例(实际以控制台操作为准) git clone https://github.com/QwenLM/Qwen-VL docker-compose -f docker-compose-gpu.yml up -d3.2 飞书通道配置
在OpenClaw中配置飞书机器人时,最容易出错的是权限配置。除了基本的"获取妙记"权限外,还需要特别注意:
- 应用需要"消息与群组"权限才能@成员
- 要开启"批量获取图片"权限才能下载会议截图
配置文件示例(敏感信息已脱敏):
{ "channels": { "feishu": { "appId": "cli_xxxxxx", "appSecret": "xxxxxxxx", "permissions": [ "妙记:妙记查看", "消息与群组:发送消息", "图片:批量获取" ] } } }3.3 多模态任务编排
这是最核心的部分。通过OpenClaw的skill机制,我们可以创建一个会议处理流水线:
# 伪代码展示处理逻辑 def process_meeting(meeting_id): # 获取妙记文本 transcript = feishu_api.get_transcript(meeting_id) # 获取所有截图 screenshots = feishu_api.get_screenshots(meeting_id) # 多模态处理 results = [] for img in screenshots: response = qwenvl_analyze( prompt="提取这张PPT中的关键数据和行动项", image=img ) results.append(response) # 生成结构化纪要 markdown = generate_markdown(transcript, results) # 发送飞书消息 feishu_api.send_to_group( content=markdown, at_users=extract_responsible_persons(transcript) )实际部署时,我将其封装为OpenClaw的skill,可以通过自然语言触发:"处理昨天下午3点的产品会议并@相关人"。
4. 实践中的经验教训
4.1 模型参数调优
最初直接使用默认参数时,模型会过度关注PPT中的装饰性元素。通过调整temperature和top_p参数,显著提高了关键信息提取的准确率:
# Qwen3-VL优化后的调用参数 { "temperature": 0.3, "top_p": 0.85, "max_length": 2048, "stop_words": ["###", "注意事项"] }4.2 错误处理机制
在真实场景中会遇到各种意外情况:
- 飞书API限流时自动重试
- 截图含有手写笔记时降级使用OCR
- 遇到模糊图片自动触发重新截图
这些都需要在OpenClaw的error_handler中预先定义:
@error_handler def handle_api_limit(e): if "rate limit" in str(e): sleep(random.uniform(1, 3)) return retry() raise e4.3 隐私与安全
由于要处理公司内部会议内容,我们做了这些防护措施:
- 所有数据仅在本地GPU服务器处理
- 纪要生成后自动删除原始录音和截图
- 为不同密级的会议设置不同的访问权限
5. 最终效果与优化空间
现在我的会议纪要流程从原来的90分钟缩短到15分钟(主要是人工复核时间)。最惊喜的是模型对技术图纸的识别能力——它能准确提取架构图中的服务名称和依赖关系。
还有两个待优化点:
- 复杂数学公式的LaTeX转换还不够稳定
- 多人同时发言的场景下,说话人识别准确率有待提高
这套方案已经在团队内部开源。随着Qwen模型的持续迭代,相信未来可以实现真正的"会议零整理"。
获取更多AI镜像
想探索更多AI镜像和应用场景?访问 CSDN星图镜像广场,提供丰富的预置镜像,覆盖大模型推理、图像生成、视频生成、模型微调等多个领域,支持一键部署。
