Gemini Live API: مكالمات صوتية تستمر أثناء البحث
تعرّف كيف تُبقي Gemini Live API المتصل في الحوار أثناء تشغيل الأدوات، ومتى تستخدم Extended Thinking، وكيف تقيس التكلفة الفعلية لكل مهمة مكتملة.

في 15 سبتمبر 2026، أتاحت Google نموذجَي Gemini 3.8 Live وGemini 3.8 Live Extended Thinking للجميع. أما التغيير العملي لمستخدمي Gemini Live API فهو واضح: يستطيع الوكيل الصوتي إبقاء المتصل على اطلاع بينما يتولى التقويم أو نظام الطلبات أو واجهة الحجز البرمجية تنفيذ المهمة البطيئة في الخلفية.
كيف تمنع Gemini Live API توقف المكالمة أثناء البحث؟
يدير الوكيل الصوتي عادة مسارين في الوقت نفسه: مواصلة حوار طبيعي، وإنجاز عمل فعلي داخل نظام آخر.
المسار الثاني هو ما يجعل المكالمات مربكة. يطلب الوكيل من واجهة الحجز موعداً شاغراً، ثم ينتظر ويترك المتصل أمام صمت كامل. عندها قد يعيد المتصل طلبه، أو يسأل إن كان أحد لا يزال على الخط، أو ينهي المكالمة. وإذا اعتبر التطبيق التكرار أمراً جديداً، فقد يشغّل المهمة نفسها مرتين.
يغيّر Gemini 3.8 Live هذا المسار عبر استدعاء الدوال غير المتزامن. أي إن الأداة تستطيع مواصلة العمل من دون تجميد الجلسة المباشرة بأكملها. وبينما لا يزال البحث جارياً، يمكن للمتصل إضافة سياق أو تصحيح معلومة أو سماع تحديث عن التقدم.
يذهب Gemini 3.8 Live Extended Thinking أبعد من ذلك؛ إذ يستطيع تحليل مهمة متعددة الخطوات وإبلاغ المتصل بتحديثات موجزة أثناء تشغيل الأدوات. وفي مثال Google، يتولى تدفق لحجز السفر فحص عدة أنظمة من دون قطع المحادثة المباشرة.
هذا لا يعني أن Gemini يجري الحجز بنفسه. يظل تطبيقك مسؤولاً عن استقبال استدعاء الدالة، وتنفيذ البحث في التقويم أو نظام الطلبات، ثم إعادة النتيجة. أما النموذج فيدير الحوار المحيط بهذا العمل.
العمود الأخير هو الفخ الحقيقي في بيئة الإنتاج. مع Extended Thinking، قد تعني turnComplete: true أن تحديثاً صوتياً وسيطاً انتهى فحسب، بينما يظل البحث قيد التنفيذ. إذا أغلقت الجلسة أو فعّلت زر الحجز أو وضعت علامة الاكتمال عند تلك اللحظة، فستسجّل عمليات مكتملة على نحو زائف.

المقياس التجاري الأهم: تكلفة كل مهمة مكتملة
الكلام أثناء العمل في الخلفية لا يعني وفراً تلقائياً. فقد يضيف مخرجات من النموذج أثناء تشغيل الأداة، كما أن إطالة المحادثة قد تزيد مقدار السياق الذي يعاد معالجته في الأدوار اللاحقة. ولا تستحق الميزة اعتمادها إلا إذا أدت استمرارية الحوار الإضافية إلى حجوزات مكتملة أكثر، أو مكالمات متروكة أقل، أو جهد بشري أقل لتصحيح النتائج.
تنشر Google الأسعار القياسية نفسها لكلا النموذجين الجديدين: تبلغ تكلفة إدخال الصوت $0.005 للدقيقة، وتكلفة إخراجه $0.018 للدقيقة. أما إدخال النص فيكلف $0.75 لكل 1 مليون رمز، فيما تبلغ تكلفة إخراج النص، بما في ذلك رموز التفكير، $4.50 لكل 1 مليون رمز.
لنفترض مكالمة حجز مدتها خمس دقائق يتحدث فيها النموذج لدقيقتين. ولأن الصوت الاستباقي مفعّل دائماً، يكون الحساب المبسط للصوت الجديد هو $0.025 مقابل خمس دقائق من الإدخال، إضافة إلى $0.036 مقابل دقيقتين من الإخراج. أي إن الإجمالي الفرعي الخام للصوت يبلغ $0.061.
لكن هذه ليست التكلفة النهائية للمكالمة.
يوضح دليل فوترة Live API أن الجلسة المستمرة قد تعيد معالجة السياق المتراكم في الأدوار اللاحقة. وتضيف النصوص المفرغة رسوماً لرموز النص، وقد يضيف Extended Thinking مخرجات التفكير. أما التقويم ونظام CRM وشركة الاتصالات والاستضافة والمحاولات المتكررة والتصعيد البشري، فجميعها خارج الإجمالي الفرعي للصوت لدى Google.
استخدم هذه المعادلة بدلاً من ذلك:
تكلفة كل مهمة مكتملة = إجمالي الإنفاق على النموذج والأداة والهاتف والبنية التحتية والمحاولات المتكررة والتصعيد، مقسوماً على عدد المهام المؤكد اكتمالها.
المهمة المكتملة ليست نصاً لطيفاً لمحادثة. في خط حجز المواعيد، تعني معرّف حجز كُتب مرة واحدة، ثم قُرئ على نحو صحيح وقبله المتصل. وفي دعم الطلبات، تعني تنفيذ الإجراء الصحيح على الطلب الصحيح المرتبط بالحساب الصحيح. أما في التحويل، فتعني وصول المكالمة إلى قائمة الانتظار المقصودة مع بقاء السياق كاملاً.
تعيد Google دورياً إجمالي الرموز المستهلكة داخل usageMetadata. اربط هذا السجل بمعرّف استدعاء الأداة وجلسة شركة الاتصالات والنتيجة التجارية النهائية وأي عمل بشري. هكذا تحصل على سجل لكل مكالمة يمكن تدقيقه، بدلاً من تقدير لكل دقيقة لا تملك سوى الوثوق به.
لا تلغي أرقام الإطلاق الحاجة إلى هذا الاختبار التجريبي. تسجل Google نسبة 68.6% في معيار مهام tau-Voice ونسبة 35.1% في نسخته المصرفية لـ Extended Thinking. تشير هذه النتائج إلى أن النموذج قابل للاختبار في أعمال الوكلاء الصوتيين، لكنها لا تخبرك بنسبة المتصلين الذين سيكملون حجزاً عبر تقويمك وسياساتك واتصالك الهاتفي.
أربع حالات يكون فيها الانتظار عاملاً حاسماً
عيادة أسنان تحجز موعداً
يستطيع مسؤول العمليات أن يدع الوكيل يجمع اليوم المفضل للمتصل، ويجري بحثاً عن المواعيد المتاحة، ويبلغه بأن البحث مستمر بينما ينتظر استجابة التقويم. العائد الحقيقي ليس مجرد تقليل الصمت، بل زيادة المواعيد المؤكدة وتقليل حاجة الموظفين إلى معاودة الاتصال.
قاعدة الأمان صارمة: التحديث الصوتي ليس حجزاً. ينبغي للنظام إنشاء الحجز فقط بعدما يختار المتصل موعداً من النتائج، وعلى المحاولات المتكررة إعادة استخدام مفتاح عدم التكرار حتى لا تنشئ المكالمة الواحدة الموعد نفسه مرتين.
فريق تجارة إلكترونية يتابع طلباً
يمكن لمسؤول الدعم إبقاء المتصل في المحادثة نفسها بينما يستعلم الوكيل من نظام الطلبات. وإذا غيّر المتصل طلبه من «أين شحنتي؟» إلى «غيّر عنوان التوصيل»، فيجب أن يعامل التطبيق الطلب الأحدث بوصفه الطلب النشط، وأن يلغي العمل الذي لم يعد مطلوباً أو يتجاهله.
العائد هو تقليل التحويلات في الحالات الروتينية. أما الخطر فهو تقديم إجابة صحيحة عن سؤال قديم بعدما انتقل المتصل إلى طلب آخر.
فريق سفر يعالج إعادة الحجز
يجعل البحث عن الرحلات والتحقق من السياسات وتوافر الفنادق ومقارنة الأسعار هذه الحالة أنسب لـ Extended Thinking. يستطيع النموذج وصف التقدم بينما تعمل عدة دوال غير حاجبة.
أبقِ الدفع وتغيير التذاكر خلف خطوة تأكيد. فالصوت الطبيعي لا يقلل معيار الموافقة المطلوب لإجراء لا يمكن التراجع عنه.
قائمة انتظار للدعم الفني تشخّص مشكلة في حساب
يناسب Gemini 3.8 Live البحث السريع في الحساب. أما التشخيص الذي يجمع عدة سجلات ويفحص إعداداً ما، فقد يبرر استخدام Extended Thinking.
هذا الفصل مهم لأن التفكير الأعمق ليس مجانياً. وجّه كل طلب وفق تعقيد المهمة، ثم قارن معدلات الحل والتصعيد. لا تمرر كل عملية إعادة تعيين لكلمة المرور عبر المسار الأثقل لمجرد أن اسم النموذج يوحي بأمان أكبر.
اضبط دورة حياة العمل في الخلفية قبل توصيل خط الهاتف
ابدأ بجلسة تُفعّل نصياً وأداة اختبار محلية. فهذا يعزل السلوك غير المتزامن قبل أن تضيف شركة الاتصالات والميكروفون وجسر الصوت وتقويم الإنتاج أربعة مواضع أخرى لاستكشاف الأعطال.
يتبع المثال أدناه حزمة Python الحالية من Google، وإعداد Extended Thinking، وتعريف الدالة غير الحاجبة، ونمط استجابة الأداة، وحقلي interaction_status وusageMetadata. ويحفظ الصوت المُعاد بتردد 24 kHz في response.wav. أما نتيجة الأداة فهي اختبار محلي، لذلك لا تمس تقويماً حقيقياً.
pip install -U google-genai
export GEMINI_API_KEY="YOUR_API_KEY"import asyncio
import wave
from google import genai
from google.genai import types
client = genai.Client()
model = "gemini-3.8-live-extended-thinking"
check_availability = types.FunctionDeclaration(
name="check_availability",
description="Checks the calendar for the next available appointment.",
behavior="NON_BLOCKING",
parameters={
"type": "OBJECT",
"properties": {},
},
)
config = types.LiveConnectConfig(
response_modalities=["AUDIO"],
thinking_config=types.ThinkingConfig(thinking_level="low"),
tools=[types.Tool(function_declarations=[check_availability])],
)
async def main():
async with client.aio.live.connect(model=model, config=config) as session:
await session.send_client_content(
turns={
"parts": [
{"text": "Find the next available appointment and keep me updated."}
]
}
)
with wave.open("response.wav", "wb") as audio:
audio.setnchannels(1)
audio.setsampwidth(2)
audio.setframerate(24000)
async for message in session.receive():
status = getattr(message, "interaction_status", None)
if message.data is not None:
audio.writeframes(message.data)
if message.usage_metadata:
print("Tokens:", message.usage_metadata.total_token_count)
if message.tool_call:
replies = []
for call in message.tool_call.function_calls:
replies.append(
types.FunctionResponse(
id=call.id,
name=call.name,
response={"result": "Tuesday morning is available."},
)
)
await session.send_tool_response(function_responses=replies)
if status == "IDLE":
print("Interaction complete")
break
if __name__ == "__main__":
asyncio.run(main())الخطأ الأرجح هو إيقاف الحلقة عند أول turnComplete. فقد يكون Extended Thinking قد قال «جارٍ التحقق» بينما لا يزال ينتظر الأداة. واصل الاستماع حتى تصبح قيمة interaction_status هي IDLE، وأبقِ معرّف استدعاء الأداة مرتبطاً بالنتيجة التجارية النهائية.
أما وكيل الهاتف في بيئة الإنتاج، فلا تضف جسر الصوت إلا بعدما تعمل هذه الحلقة كما ينبغي. تساعد مقارنة تكلفة وكلاء الصوت بالذكاء الاصطناعي الأوسع في اختيار طبقتَي الاتصالات والتنسيق المحيطتين بالنموذج. وإذا كنت تقارن مقياس الرموز لدى Google بسعر صوتي أبسط في الواجهة الأمامية، يوضح تحليل تكلفة مكالمات GPT-Live-1 لماذا يظل عدد المهام المكتملة هو المقام الصحيح في الحالتين.
ابنِ الاختبار التجريبي حول سجل نتائج، لا عرض توضيحي
اختر حدثاً واحداً يثبت الاكتمال
استخدم مسار عمل ضيقاً واحداً، مثل موعد مؤكد. دوّن حدث قاعدة البيانات المحدد الذي يثبت الاكتمال، وسمِّ كل حالة تُعد فشلاً أو تخلياً أو عملاً مكرراً أو تصعيداً بشرياً.
سجّل دورة الجلسة المباشرة
احفظ معرّف الجلسة وكل معرّف لاستدعاء أداة وتغييرات
interaction_statusوأوقات بدء الأدوات وانتهائها وusageMetadata. العبارة التي تملأ الصمت تحديث للتقدم، وليست دليلاً على الاكتمال.اربط كل طبقات التكلفة
اربط استخدام Gemini ورسوم التقويم أو CRM وتكاليف شركة الاتصالات والبنية التحتية والمحاولات المتكررة ووقت الموظفين بسجل المكالمة نفسه. لا تقارن الإجمالي الفرعي التوضيحي للصوت لدى Google، والبالغ $0.061، بفاتورة شاملة للنظام الحالي.
اختبر مسارات الفشل
قاطع الوكيل، وغيّر التاريخ المطلوب أثناء تشغيل البحث، واجعل مهلة الأداة تنتهي، وأعد نتيجة بلا مواعيد متاحة، وأنهِ المكالمة قبل ظهور النتيجة. ثم تأكد من أن الاستدعاءات القديمة لا تستطيع تسجيل حجز.
قارن المهام المكتملة
مرّر أنواع المكالمات نفسها عبر المسار الحالي والمسار الجديد. وقارن الاكتمال المؤكد والتخلي وجهد التصعيد والإجراءات المكررة وإجمالي تكلفة كل مهمة مكتملة. لا تعلن عن وفر إلا بعد تطابق هذه السجلات.
الحدود التي ينبغي قولها بوضوح
يستطيع النموذج ملء الصمت، لكنه لا يستطيع تسريع تقويم بطيء أو إصلاح اتصال هاتفي سيئ أو تحديد ما تعتبره شركتك مهمة مكتملة.
لا تتجاوز الجلسات التي تعتمد على الصوت وحده 15 دقيقة ما لم تضف تقنيات لإدارة الجلسات الأطول. ويبلغ حد السياق للصوت الأصلي 128,000 رمز. كما تختلف تكلفة المكالمات الطويلة كثيرة الأدوار عن تقدير بسيط قائم على المدة، لأن السياق القديم قد يُعالج مجدداً.
يظل الأمان من مسؤولية تطبيقك. ينبغي للمتصفح الذي يتصل مباشرة استخدام رموز مؤقتة، لا مفتاح API قياسياً. كما يظل الحجز أو رد المبلغ أو تغيير الحساب بحاجة إلى المصادقة والتحقق ومنع تكرار التنفيذ وسجل تدقيق.
يضيف المسار غير المتزامن خطراً آخر في الإنتاج: نتائج المهام التي لم تعد ذات صلة. فإذا غيّر المتصل طلبه أثناء تشغيل أداة، قد تصل النتيجة القديمة لاحقاً. تتبّع حالة المهمة صراحة وارفض النتائج التي لم تعد تطابق النية الحالية.
خطوة الاثنين: راقب قائمة انتظار ضيقة واحدة
تحرك هذا الأسبوع إذا كانت فترات الصمت أثناء انتظار الأدوات تدفع المتصلين إلى تكرار طلباتهم أو التخلي عن الحجز أو تتطلب من الموظفين إصلاح النتائج. استخدم Gemini 3.8 Live لعمليات البحث المباشرة، وExtended Thinking لمسار واحد متعدد الخطوات فعلاً، وضع كليهما خلف سجل الاكتمال نفسه.
انتظر إذا لم تكن تستطيع بعد إثبات الاكتمال داخل نظامك، أو إذا كان مسار شركة الاتصالات غير مستقر، أو إذا احتوى سير العمل على إجراء لا يمكن التراجع عنه من دون بوابة تأكيد. أنت تحتاج إلى السجل قبل أن تحتاج إلى النموذج الجديد.
لا يفيد هذا الإصدار المنتجات التي تعمل بالنص فقط، ولا المسارات الصوتية التي تعيد أدواتها النتائج فوراً، ولا وكيلاً هاتفياً يعمل بالفعل ويحقق أهداف الاكتمال والتصعيد والتكلفة. فوجود نموذج جديد ليس سبباً لاستبدال نظام جرى قياسه.
للمزيد من الشروحات الواضحة حول التغييرات التي تؤثر في تكاليف التشغيل ومسارات العمل، اشترك في النشرة البريدية.
- آخر تحديث
- 16 سبتمبر 2026
- التصنيف
- Explained







