
本文介绍如何通过提示工程与函数调用机制,无需微调即可让本地或云端大语言模型(如ollama部署的模型)理解用户指令、结构化提取意图,并联动api执行真实动作(如开关灯光),兼顾响应准确性与系统安全性。
本文介绍如何通过提示工程与函数调用机制,无需微调即可让本地或云端大语言模型(如ollama部署的模型)理解用户指令、结构化提取意图,并联动api执行真实动作(如开关灯光),兼顾响应准确性与系统安全性。
在构建智能家居聊天机器人时,核心挑战并非“训练模型学会开关灯”,而是让模型可靠地理解用户意图、准确结构化表达动作,并安全交由外部系统执行。幸运的是,现代LLM(尤其是具备强推理与JSON生成能力的模型,如Llama 3、Phi-3 或 Qwen2)无需微调即可胜任此类任务——关键在于设计清晰的提示(Prompt)与构建稳健的执行层。
✅ 推荐方案:提示工程 + 结构化输出 + 外部执行器
避免对模型进行全量微调(成本高、泛化差、更新维护难),转而采用轻量、可解释、易调试的三段式架构:
-
指令解析层(Prompt-driven JSON generation)
通过系统级提示强制模型输出标准化JSON,明确指定动作类型与设备标识。例如,在Ollama中调用模型时,使用如下结构化提示:
你是一个智能家居助理。请严格按以下JSON格式响应,不得添加任何额外文本、注释或Markdown:
{
"action": "turn-on-light | turn-off-light | adjust-temperature",
"device": "living-room-light | kitchen-fan | bedroom-ac",
"value": "optional numeric or string value (e.g., '25' for temperature)"
}
Human: 把客厅的灯打开
Assistant: {"action": "turn-on-light", "device": "living-room-light"}
Human: 关掉厨房的抽风机
Assistant: {"action": "turn-off-fan", "device": "kitchen-fan"}
Human:
✅ 提示要点:强调“严格JSON格式”“不得添加额外内容”,并提供2–3个高质量示例(few-shot learning),显著提升结构化输出稳定性。
-
解析与路由层(Python + Pydantic)
使用pydantic.BaseModel定义动作Schema,自动校验并反序列化解析结果,防止无效JSON导致程序崩溃:
from pydantic import BaseModel, Field
from typing import Optional
class DeviceAction(BaseModel):
action: str = Field(..., pattern=r"^(turn-on|turn-off)-(light|fan|ac)$")
device: str
value: Optional[str] = None
# 示例解析
try:
action = DeviceAction.model_validate_json(llm_output)
# 路由至对应API
if action.action == "turn-on-light":
call_light_api(action.device, "on")
except Exception as e:
print(f"Invalid response from LLM: {e}")
-
执行与反馈层(同步/异步API调用 + 自然语言回写)
执行成功后,再调用LLM生成自然语言反馈(如“I will turn on the light in the living room”),实现“思考→行动→表达”闭环。可借助LangChain的Tool抽象或自定义函数封装:
from langchain_core.tools import tool
@tool
def control_smart_device(action: str, device: str, value: str = None) -> str:
"""Control smart home device via REST API"""
# 实际调用你的Home Assistant / MQTT / 自研API
api_response = requests.post(
f"https://api.home.local/devices/{device}/control",
json={"command": action, "value": value}
)
return "success" if api_response.status_code == 200 else "failed"
# 在链中集成:LLM → 解析 → tool调用 → 生成最终回复
⚠️ 关键注意事项
- 安全性优先:所有设备控制必须经过白名单校验(如只允许living-room-light等预注册ID),禁止模型自由构造device字段;建议在Pydantic模型中使用Literal或枚举约束。
- 降级策略:当LLM输出非JSON或字段缺失时,应返回友好错误(如“未识别设备,请确认名称”),而非静默失败。
- Ollama适配技巧:使用--format json参数启动Ollama服务(如ollama run llama3 --format json),配合--keep-alive保障会话状态;也可在Modelfile中嵌入system prompt。
- 替代方案对比:OpenAI Function Calling 是成熟范式(官方指南),但若坚持本地部署,上述Prompt+Pydantic方案更轻量可控;Qwen2、Phi-3等开源模型已原生支持工具调用微调,亦可探索其tool_call格式。
综上,让LLM“执行动作”的本质,是将其定位为高精度意图解析器与结构化翻译器,而非直接执行引擎。真正可靠的自动化,来自清晰的协议设计、严格的输入校验与解耦的执行边界——这比微调模型更高效、更安全、更可持续。










