close

Top 10+ LLM lấy API Key miễn phí cho AI Agent (cập nhật 2026)

Tác giả: Đông Tùng Ngày đăng: 12/05/2026 Chuyên mục: AI & Automation
Disclosure
Website Tino blog được cung cấp bởi Tino Group. Truy cập và sử dụng website đồng nghĩa với việc bạn đồng ý với các điều khoản và điều kiện trong chính sách bảo mật - điều khoản sử dụng nội dung. Wiki.tino.org có thể thay đổi điều khoản sử dụng bất cứ lúc nào. Việc bạn tiếp tục sử dụng Tino blog sau khi thay đổi có nghĩa là bạn chấp nhận những thay đổi đó.
Why Trust Us
Các bài viết với hàm lượng tri thức cao tại Tino blog được tạo ra bởi các chuyên viên Marketing vững chuyên môn và được kiểm duyệt nghiêm túc theo chính sách biên tập bởi đội ngũ biên tập viên dày dặn kinh nghiệm. Mọi nỗ lực của chúng tôi đều hướng đến mong muốn mang đến cho cộng đồng nguồn thông tin chất lượng, chính xác, khách quan, đồng thời tuân thủ các tiêu chuẩn cao nhất trong báo cáo và xuất bản.

Nếu bạn đang xây dựng AI Agent, cần biết rõ một điều: chi phí API có thể “ăn” hết ngân sách trước khi sản phẩm kịp ra mắt. Do đó, để tối ưu ngân sách trong quá trình thử nghiệm và triển khai, việc tận dụng những nguồn cung cấp API Key miễn phí là giải pháp cực kỳ hiệu quả. Bài viết dưới đây sẽ tổng hợp danh sách top 10+ nền tảng LLM lấy API Key miễn phí cho AI Agent của bạn.

Tại sao việc chọn đúng LLM miễn phí quan trọng với AI Agent?

AI Agent khác chatbot thông thường ở chỗ: mỗi vòng lặp suy nghĩ – hành động (think–act loop) của agent đều tốn ít nhất một lần gọi API. Một agent phức tạp có thể tạo ra hàng chục, thậm chí hàng trăm request mỗi phiên làm việc. Với mô hình tính phí theo token, chi phí tích lũy rất nhanh.

Chọn đúng provider miễn phí sẽ giúp bạn:

  • Phát triển và thử nghiệm không tốn kém
  • Kết hợp nhiều provider theo từng loại tác vụ (routing)
  • Trì hoãn thời điểm phải nâng cấp lên gói trả phí
Tại sao việc chọn đúng LLM miễn phí quan trọng với AI Agent?
Tại sao việc chọn đúng LLM miễn phí quan trọng với AI Agent?

Tiêu chí lựa chọn trong bài này:

  • Free tier vĩnh viễn (không phải trial)
  • Không yêu cầu thẻ tín dụng khi đăng ký
  • API tương thích OpenAI-format (dễ tích hợp vào agent framework như LangChain, CrewAI, AutoGen…)

Top 10+ LLM lấy API Key miễn phí cho AI Agent

1. Google AI Studio

Link: aistudio.google.com

Google AI Studio là một trong những nền tảng phù hợp nhất dành cho người mới bắt đầu sử dụng API LLM. Nền tảng cho phép người dùng tạo API Key và truy cập các model Gemini để xử lý văn bản, hình ảnh, âm thanh, video và tài liệu.

Google cung cấp Free Tier cho nhiều model Gemini. Hạn mức sử dụng được áp dụng riêng theo từng model, tài khoản và dự án, bao gồm:

  • RPM: số yêu cầu mỗi phút.
  • TPM: số token mỗi phút.
  • RPD: số yêu cầu mỗi ngày.

Quota hằng ngày thường được đặt lại theo giờ Thái Bình Dương. Người dùng có thể kiểm tra hạn mức cụ thể trong Google AI Studio hoặc Google Cloud Console.

1. Google AI Studio
1. Google AI Studio

Xem thêm: Hướng dẫn cách lấy API Key của Gemini AI

Điểm nổi bật:

  • Có Free Tier cho nhiều model Gemini.
  • Hỗ trợ xử lý dữ liệu đa phương thức.
  • Cửa sổ ngữ cảnh lớn.
  • Có structured output và function calling.
  • Dễ tích hợp với chatbot và AI Agent.
  • Phù hợp để phân tích tài liệu, hình ảnh và video.

Phù hợp với: người mới học API, chatbot, trợ lý tài liệu và AI Agent đa phương thức.

2. Groq

Link: console.groq.com

Groq cung cấp API inference tốc độ cao nhờ hạ tầng Language Processing Unit – LPU. Nền tảng phù hợp với những ứng dụng cần phản hồi nhanh như chatbot thời gian thực, voice agent và trợ lý lập trình.

Groq Free Plan hỗ trợ nhiều model mã nguồn mở với hạn mức khác nhau.

Một số hạn mức nổi bật:

  • Llama 3.1 8B Instant: 30 RPM, 14.400 RPD và 500.000 token mỗi ngày.
  • Llama 3.3 70B Versatile: 30 RPM, 1.000 RPD và 100.000 token mỗi ngày.
  • Llama 4 Scout: 30 RPM, 1.000 RPD và 500.000 token mỗi ngày.
  • Qwen3 32B: 60 RPM, 1.000 RPD và 500.000 token mỗi ngày.
  • GPT OSS 120B: 30 RPM, 1.000 RPD và 200.000 token mỗi ngày.

Groq cung cấp API tương thích OpenAI. Người dùng có thể chuyển từ OpenAI sang Groq bằng cách thay API Key, model và Base URL.

2. Groq
2. Groq

Điểm nổi bật:

  • Tốc độ sinh token cao.
  • Hỗ trợ nhiều model mã nguồn mở.
  • Có Free Plan.
  • Tương thích OpenAI SDK.
  • Phù hợp với các tác vụ yêu cầu độ trễ thấp.

Phù hợp với: chatbot phản hồi nhanh, voice agent, trợ lý lập trình và AI Agent thời gian thực.

3. OpenRouter

Link: openrouter.ai

OpenRouter là nền tảng tổng hợp API model AI từ nhiều nhà cung cấp. Người dùng chỉ cần một API Key để truy cập các model của Google, Meta, Mistral, DeepSeek, Qwen và nhiều nhà phát triển khác.

Các model miễn phí trên OpenRouter thường có hậu tố :free trong tên model.

Hạn mức đối với model miễn phí:

  • Tài khoản chưa từng mua tối thiểu 10 USD credit: tối đa 50 yêu cầu mỗi ngày.
  • Tài khoản đã mua tổng cộng từ 10 USD credit: tối đa 1.000 yêu cầu miễn phí mỗi ngày.
  • Rate limit có thể khác nhau tùy model và provider.
  • Request có thể bị chậm hoặc trả về lỗi khi provider miễn phí quá tải.

OpenRouter còn hỗ trợ routing và fallback. Khi một provider gặp lỗi, hệ thống có thể chuyển request sang provider khác đang cung cấp cùng model.

3. OpenRouter
3. OpenRouter

Điểm nổi bật:

  • Truy cập nhiều model bằng một API Key.
  • Có nhiều model miễn phí.
  • Tương thích OpenAI SDK.
  • Hỗ trợ routing và fallback.
  • Dễ thử nghiệm, benchmark và thay đổi model.

Phù hợp với: AI Agent đa model, thử nghiệm benchmark và hệ thống cần provider dự phòng.

Xem thêm: OpenRouter là gì?

4. Cerebras

Link: inference.cerebras.ai

Cerebras Inference là nền tảng API nổi bật nhờ tốc độ xử lý cao trên kiến trúc Wafer-Scale Engine. Dịch vụ cung cấp quyền truy cập miễn phí vào các model đang hoạt động trên public endpoint.

Danh sách model có thể gồm model production và model preview. Một số model đáng chú ý bao gồm GPT OSS 120B, GLM và các model Gemma mới.

Hạn mức Free Tier phổ biến:

  • 5 yêu cầu mỗi phút.
  • 30.000 token mỗi phút.
  • 1 triệu token mỗi giờ.
  • 1 triệu token mỗi ngày.

Hạn mức được áp dụng theo tổ chức và theo từng model. Các model preview có thể được cập nhật hoặc thay thế theo từng giai đoạn.

Cerebras hỗ trợ API tương thích OpenAI, giúp người dùng tích hợp vào ứng dụng mà không cần thay đổi quá nhiều mã nguồn.

4. Cerebras
4. Cerebras

Điểm nổi bật:

  • Tốc độ inference cao.
  • Hỗ trợ model có kích thước lớn.
  • Có API tương thích OpenAI.
  • Phù hợp với reasoning và lập trình.
  • Có quota token miễn phí tương đối lớn.

Phù hợp với: thử nghiệm model lớn, reasoning, trợ lý lập trình và AI Agent cần phản hồi nhanh.

5. NVIDIA NIM

Link: build.nvidia.com

NVIDIA NIM cung cấp các API inference được tối ưu trên hạ tầng NVIDIA. Nền tảng hỗ trợ nhiều nhóm model dành cho text generation, vision, embedding, reranking, speech và các tác vụ chuyên ngành.

Thành viên NVIDIA Developer Program có thể sử dụng endpoint NIM miễn phí để nghiên cứu, phát triển, thử nghiệm và xây dựng prototype.

5. NVIDIA NIM
5. NVIDIA NIM

Xem thêm: Cách dùng API miễn phí với NVIDIA AI

Quyền truy cập nổi bật:

  • Tạo API Key trên trang của từng model.
  • Sử dụng endpoint miễn phí cho mục đích phát triển.
  • Truy cập nhiều model như Nemotron, Llama, Phi, Kimi và các model vision.
  • Có thể tải NIM về tự triển khai trên hạ tầng phù hợp.
  • Hỗ trợ môi trường thử nghiệm với tối đa 16 GPU theo điều kiện của NVIDIA Developer Program.

Các endpoint miễn phí phù hợp với hoạt động nghiên cứu và prototype. Hệ thống production thương mại cần sử dụng giấy phép và gói dịch vụ phù hợp của NVIDIA.

Phù hợp với: thử nghiệm model mới, RAG, vision, embedding và AI Agent trong hệ sinh thái NVIDIA.

6. SambaNova Cloud

Link: cloud.sambanova.ai

SambaNova Cloud cung cấp API inference tốc độ cao cho nhiều model ngôn ngữ lớn như Llama, DeepSeek, GPT OSS, MiniMax và các model reasoning.

Người dùng mới có thể nhận 5 USD credit miễn phí mà không cần nhập thẻ. Credit dùng thử có thời hạn 30 ngày.

Tài khoản chưa liên kết phương thức thanh toán cũng có thể sử dụng Free Tier đối với các model được hỗ trợ.

6. SambaNova Cloud
6. SambaNova Cloud

Hạn mức Free Tier:

  • 20 yêu cầu mỗi phút.
  • 20 yêu cầu mỗi ngày cho từng model.
  • Tổng cộng 200.000 token mỗi ngày.
  • Hạn mức được áp dụng với từng model miễn phí.
  • Model preview có thể được thay đổi hoặc gỡ bỏ.

SambaNova phù hợp để thử nghiệm khả năng của model lớn hoặc benchmark tốc độ. Hạn mức 20 request mỗi ngày trên từng model chưa phù hợp với các AI Agent hoạt động liên tục.

Phù hợp với: benchmark tốc độ, thử model lớn và thực hiện các bài kiểm tra ngắn.

7. Mistral La Plateforme

Link: console.mistral.ai

Mistral cung cấp free tier với 1 tỷ token mỗi tháng trên tất cả model Mistral (Small, Large, Embed). Đây là lựa chọn nổi bật cho RAG pipeline vì bạn có cả generation và embedding model trên cùng một tài khoản miễn phí.

7. Mistral La Plateforme
7. Mistral La Plateforme

Điểm nổi bật của Free Mode:

  • Hỗ trợ chat completion.
  • Có model dành cho lập trình.
  • Hỗ trợ embedding và semantic search.
  • Có API OCR để xử lý tài liệu.
  • Hỗ trợ function calling.
  • Hỗ trợ structured output.
  • Phù hợp với prototype và thử nghiệm API.

Người dùng có thể cần xác minh tài khoản hoặc cung cấp thêm thông tin để mở khóa một số tính năng và hạn mức.

Phù hợp với: RAG, xử lý tài liệu, trợ lý lập trình, OCR và AI Agent sử dụng model châu Âu.

8. Cloudflare Workers AI

Link: developers.cloudflare.com/workers-ai

Cloudflare Workers AI cho phép chạy model AI trên hạ tầng edge của Cloudflare. Nền tảng phù hợp với website, ứng dụng serverless và các hệ thống đang sử dụng Cloudflare Workers.

Free Plan cung cấp:

  • 10.000 Neurons miễn phí mỗi ngày.
  • Quota được đặt lại lúc 00:00 UTC.
  • Hơn 50 model mã nguồn mở.
  • Hỗ trợ text generation, embedding, speech, image generation và nhiều tác vụ khác.

Neurons là đơn vị Cloudflare sử dụng để tính mức tiêu thụ tài nguyên AI. Mỗi model và tác vụ sẽ sử dụng lượng Neurons khác nhau.

Rate limit cũng được áp dụng riêng theo từng nhóm tác vụ. Text generation, embedding, speech recognition và image generation có thể có giới hạn khác nhau.

8. Cloudflare Workers AI
8. Cloudflare Workers AI

Điểm nổi bật:

  • Chạy inference tại edge.
  • Tích hợp trực tiếp với Cloudflare Workers.
  • Có model text, image, speech và embedding.
  • Phù hợp với ứng dụng serverless.
  • Không cần tự quản lý GPU.

Phù hợp với: chatbot website, ứng dụng edge, semantic search và hệ thống RAG nhẹ.

nhất cho: Serverless AI agent, ứng dụng toàn cầu cần latency thấp, agent tích hợp sẵn trong hệ sinh thái Cloudflare Workers.

9. GitHub Models

Link: github.com/marketplace/models

GitHub Models cho phép lập trình viên thử nghiệm nhiều model AI trực tiếp trên GitHub Marketplace và Playground.

Người dùng có thể tạo Personal Access Token để gọi model thông qua API. GitHub Models hỗ trợ nhiều model từ OpenAI, Meta, Microsoft, Mistral, DeepSeek và các nhà cung cấp khác.

Hạn mức miễn phí phụ thuộc vào:

  • Model được sử dụng.
  • Loại tài khoản GitHub.
  • Kích thước prompt.
  • Số token đầu ra.
  • Loại request.
  • Mức độ tải của hệ thống.

GitHub không áp dụng một quota chung cho tất cả model. Người dùng có thể theo dõi giới hạn và thông báo trực tiếp trong Playground hoặc tài liệu của từng model.

9. GitHub Models
9. GitHub Models

Điểm nổi bật:

  • Có Playground để kiểm tra prompt.
  • Truy cập nhiều model trên cùng nền tảng.
  • Có API dành cho lập trình viên.
  • Hỗ trợ so sánh đầu ra giữa các model.
  • Tích hợp thuận tiện với quy trình phát triển trên GitHub.

Phù hợp với: lập trình viên, thử nghiệm prompt, đánh giá model và tích hợp AI vào repository.

10. Cohere

Link: dashboard.cohere.com

Cohere cung cấp các model và API dành cho chatbot doanh nghiệp, tìm kiếm ngữ nghĩa và hệ thống RAG.

Người dùng có thể tạo Trial API Key để thử nghiệm các dịch vụ Command, Embed và Rerank.

Hạn mức Trial API Key:

  • Tổng cộng 1.000 API call mỗi tháng.
  • Chat API: 20 yêu cầu mỗi phút cho từng model.
  • Rerank API: 10 yêu cầu mỗi phút.
  • Embed API: tối đa 2.000 đầu vào văn bản mỗi phút.
  • Image Embed có hạn mức riêng.

Trial API Key phù hợp với đánh giá, học tập và prototype. Các ứng dụng production cần chuyển sang Production API Key.

10. Cohere
10. Cohere

Điểm nổi bật:

  • Model Command dành cho chatbot và AI Agent.
  • Embed phục vụ semantic search.
  • Rerank giúp cải thiện kết quả RAG.
  • Hỗ trợ nhiều ngôn ngữ.
  • Phù hợp với dữ liệu doanh nghiệp.

Phù hợp với: RAG, tìm kiếm ngữ nghĩa, chatbot doanh nghiệp và trợ lý kiến thức nội bộ.

11. Hugging Face Inference API

Link: huggingface.co

Hugging Face Inference Providers cho phép người dùng truy cập nhiều model và nhà cung cấp inference thông qua một nền tảng thống nhất.

Tài khoản Hugging Face Free nhận 0,10 USD credit mỗi tháng để sử dụng routed inference.

Các gói khác có mức credit cao hơn:

  • Tài khoản PRO: 2 USD credit mỗi tháng.
  • Team và Enterprise: 2 USD credit mỗi ghế mỗi tháng.

Sau khi sử dụng hết credit, người dùng cần mua thêm credit hoặc chuyển sang hình thức thanh toán phù hợp để tiếp tục gọi API.

Hugging Face hỗ trợ hơn 200 model từ nhiều inference provider. Một số tác vụ có thể được gọi thông qua API tương thích OpenAI.

11. Hugging Face Inference API
11. Hugging Face Inference API

Điểm nổi bật:

  • Danh mục model phong phú.
  • Có nhiều inference provider.
  • Hỗ trợ text, image, embedding và machine learning.
  • Dễ khám phá model mới.
  • Tích hợp trực tiếp với hệ sinh thái Hugging Face.

Phù hợp với: thử nghiệm model, image generation, embedding và các dự án machine learning.

12. Fireworks AI

Link: fireworks.ai

Fireworks AI cung cấp API inference cho nhiều model mã nguồn mở. Nền tảng hỗ trợ serverless inference, fine-tuning và triển khai model tùy chỉnh.

Người dùng mới nhận 1 USD credit miễn phí để thử nghiệm dịch vụ.

12. Fireworks AI
12. Fireworks AI

Cơ chế sử dụng:

  • Có thể bắt đầu mà chưa cần trả phí.
  • Credit được trừ theo lượng token và model sử dụng.
  • Tài khoản không có phương thức thanh toán sẽ tạm dừng khi hết credit.
  • Người dùng cần thêm phương thức thanh toán hoặc nạp credit để tiếp tục.
  • Tài khoản chưa có payment method thường chịu giới hạn khoảng 10 RPM ở cấp tài khoản.

Fireworks AI phù hợp để thử nghiệm hiệu suất các model mã nguồn mở trước khi triển khai với lưu lượng lớn.

Phù hợp với: serverless inference, fine-tuning, benchmark model và xây dựng prototype.

13. Beeknoee Platform

Link: https://beeknoee.com/

Beeknoee Platform là nền tảng API AI do doanh nghiệp Việt Nam phát triển. Dịch vụ cung cấp một endpoint thống nhất để truy cập nhiều model từ OpenAI, Anthropic, Google, DeepSeek, xAI, Moonshot, Alibaba, Meta, MiniMax và các nhà cung cấp khác.

Beeknoee hỗ trợ hơn 100 model cho nhiều tác vụ như:

  • Text generation.
  • Vision.
  • Embedding.
  • Text-to-speech.
  • Lập trình.
  • Reasoning.

Nền tảng cung cấp model miễn phí và chương trình dùng thử. Danh sách model miễn phí cùng hạn mức được hiển thị trực tiếp trong Dashboard.

Beeknoee Platform
Beeknoee Platform

Điểm nổi bật:

  • Một API Key dùng được với nhiều model.
  • Tương thích OpenAI SDK.
  • Chỉ cần thay API Key và Base URL khi chuyển từ OpenAI.
  • Hỗ trợ smart routing.
  • Có cơ chế chuyển provider dự phòng.
  • Thanh toán bằng QR ngân hàng Việt Nam.
  • Mức nạp tối thiểu từ 20.000 đồng.
  • Có đội ngũ hỗ trợ bằng tiếng Việt.

Phù hợp với: người dùng Việt Nam, AI Agent đa model, thanh toán nội địa và hệ thống cần API tương thích OpenAI.

14. SiliconFlow

Link: https://www.siliconflow.com/

SiliconFlow là nền tảng inference cung cấp API cho nhiều model ngôn ngữ, embedding, reranking, speech, hình ảnh và video.

Danh mục model nổi bật gồm DeepSeek, Qwen, GLM, Kimi và nhiều model mã nguồn mở khác.

Người dùng mới nhận 1 USD credit để thử nghiệm các model trả phí. SiliconFlow cũng cung cấp một số model miễn phí với hạn mức riêng.

SiliconFlow
SiliconFlow

Hạn mức sử dụng:

  • Model miễn phí có rate limit cố định.
  • Model trả phí có hạn mức tăng theo cấp độ tài khoản.
  • Tài khoản mới bắt đầu ở cấp L0.
  • Cấp L0 có hạn mức tổng quát khoảng 1.000 RPM và 40.000 TPM.
  • Một số model lớn có rate limit thấp hơn.
  • Mỗi model có quota riêng.
  • Chạm hạn mức của một model không làm ảnh hưởng đến các model khác.

Người dùng có thể xem nhãn miễn phí, giá token và hạn mức trực tiếp tại trang Models hoặc Dashboard.

Điểm nổi bật:

  • Hỗ trợ nhiều model Trung Quốc.
  • Có model miễn phí.
  • Có credit dành cho người dùng mới.
  • Hỗ trợ API tương thích OpenAI.
  • Cung cấp model text, image, video và embedding.
  • Phù hợp với DeepSeek, Qwen, GLM và Kimi.

Phù hợp với: AI Agent sử dụng model Trung Quốc, RAG, tạo hình ảnh, video và ứng dụng đa phương thức.

15. Ollama Cloud

Link: https://ollama.com/

Ollama được biết đến rộng rãi là công cụ chạy model AI trên máy tính cá nhân. Bên cạnh khả năng chạy local, nền tảng còn cung cấp Ollama Cloud để người dùng truy cập các model lớn mà không cần tải toàn bộ trọng số về máy.

Gói Free có giá 0 USD và bao gồm:

  • Chạy model trên phần cứng cá nhân.
  • Truy cập cloud model.
  • Sử dụng Ollama CLI.
  • Sử dụng API.
  • Sử dụng ứng dụng desktop.
  • Chạy đồng thời một cloud model.
  • Không giới hạn số public model khi chạy local.

Ollama Cloud không áp dụng một số lượng request hoặc token cố định cho mọi tài khoản. Quota phụ thuộc vào thời gian sử dụng GPU, kích thước model và khối lượng tính toán.

Ollama Cloud
Ollama Cloud

Cơ chế giới hạn của gói Free:

  • Phù hợp với nhu cầu sử dụng nhẹ.
  • Session limit được đặt lại sau mỗi 5 giờ.
  • Weekly limit được đặt lại sau mỗi 7 ngày.
  • Model nhỏ tiêu thụ ít quota hơn.
  • Model reasoning và model lớn tiêu thụ quota nhanh hơn.
  • Chỉ chạy đồng thời một cloud model.
  • Model chạy trên phần cứng cá nhân không sử dụng quota cloud.

Ollama cung cấp API cho cả model local và cloud. Người dùng có thể giữ nguyên quy trình phát triển khi chuyển đổi giữa hai môi trường.

Điểm nổi bật:

  • Kết hợp model local và cloud.
  • Dễ sử dụng qua CLI và API.
  • Phù hợp với dữ liệu riêng tư.
  • Không cần GPU mạnh để thử model cloud.
  • Có thể tích hợp với Open WebUI, n8n và nhiều công cụ AI Agent.

Phù hợp với: AI Agent local, hệ thống ưu tiên riêng tư và mô hình kết hợp local – cloud.

Bảng so sánh nhanh:

Nền tảngHình thức miễn phíHạn mức nổi bậtĐiểm mạnhLưu ý
Google AI StudioFree TierPhụ thuộc model, dự án và tài khoảnGemini đa phương thức, context lớnKiểm tra quota trong AI Studio
GroqFree PlanLlama 8B: 14.400 RPD; Llama 70B: 1.000 RPDTốc độ inference caoHạn mức khác nhau theo model
OpenRouterModel :free50 RPD hoặc 1.000 RPD sau khi mua từ 10 USD creditNhiều provider trong một APIModel miễn phí có thể quá tải
CerebrasFree Tier5 RPM, 1 triệu token mỗi ngàyModel lớn, tốc độ caoDanh sách model có thể thay đổi
NVIDIA NIMMiễn phí cho prototypeHạn mức phụ thuộc model và tài khoảnNhiều model và tác vụ AIProduction cần giấy phép phù hợp
SambaNova CloudFree Tier và trial credit20 RPM, 20 RPD mỗi model, 200.000 token mỗi ngàyInference nhanhCredit dùng thử có thời hạn
MistralFree ModeHiển thị trong Admin ConsoleChat, OCR, embedding, codingHạn mức phụ thuộc tài khoản
Cloudflare Workers AIFree allocation10.000 Neurons mỗi ngàyChạy tại edge, tích hợp WorkersMức tiêu thụ khác nhau theo model
GitHub ModelsQuyền truy cập miễn phí có giới hạnPhụ thuộc model và tài khoảnPlayground, API, đánh giá modelChưa có quota chung cho mọi model
CohereTrial API Key1.000 API call mỗi thángRAG, Embed, RerankKhông dành cho production
Hugging FaceCredit hằng tháng0,10 USD mỗi tháng cho tài khoản FreeHơn 200 model và providerCredit miễn phí tương đối thấp
Fireworks AITrial credit1 USD credit ban đầuServerless inference, fine-tuningHết credit cần nạp thêm
Beeknoee PlatformModel miễn phí và dùng thửHạn mức hiển thị trong DashboardHơn 100 model, thanh toán Việt NamQuota phụ thuộc từng model
SiliconFlowModel miễn phí và credit1 USD credit, quota theo modelDeepSeek, Qwen, GLM, image và videoHạn mức khác nhau theo model
Ollama CloudFree PlanSession reset sau 5 giờ, weekly reset sau 7 ngàyKết hợp model local và cloudQuota phụ thuộc GPU-time

Nên chọn nền tảng API miễn phí nào?

Mỗi nền tảng sẽ phù hợp với một nhu cầu khác nhau:

  • Cần quota lớn để thử nghiệm: Google AI Studio, Groq hoặc Cerebras.
  • Cần sử dụng nhiều model: OpenRouter, Beeknoee Platform hoặc SiliconFlow.
  • Cần tốc độ phản hồi cao: Groq, Cerebras hoặc SambaNova Cloud.
  • Cần xây dựng hệ thống RAG: Cohere, Mistral hoặc Cloudflare Workers AI.
  • Cần chạy model trên máy cá nhân: Ollama.
  • Cần thử nhiều model mới: NVIDIA NIM, Hugging Face hoặc GitHub Models.
  • Cần thanh toán bằng phương thức Việt Nam: Beeknoee Platform.
  • Cần sử dụng DeepSeek, Qwen, GLM hoặc Kimi: SiliconFlow.
  • Cần kết hợp model local và cloud: Ollama Cloud.

Trong giai đoạn thử nghiệm, bạn có thể cấu hình nhiều provider và thiết lập cơ chế fallback. Khi một nền tảng hết quota, quá tải hoặc trả về lỗi 429, AI Agent có thể tự động chuyển sang provider dự phòng.

Cách triển khai này giúp hệ thống hoạt động ổn định hơn, tận dụng được nhiều nguồn API miễn phí và hạn chế phụ thuộc hoàn toàn vào một nhà cung cấp.

Kết luận

Việc lựa chọn đúng nhà cung cấp LLM API miễn phí không chỉ giúp tối ưu hóa chi phí mà còn tạo nền tảng vững chắc cho quá trình vận hành AI Agent. Hãy bắt đầu đăng ký một API Key phù hợp, cấu hình trực tiếp vào dự án hiện tại và trải nghiệm tốc độ xử lý ưu việt của hệ thống. Đừng quên lưu lại danh sách này để luôn có phương án dự phòng hiệu quả cho các tác vụ lập trình sắp tới.

Những câu hỏi thường gặp

OpenAI có cung cấp API key miễn phí không?

Tính đến năm 2026, OpenAI không còn cấp credit dùng thử miễn phí tự động. Tài khoản mới cần nhập thông tin thẻ tín dụng mới có thể gọi API. Nếu cần API tương thích OpenAI format hoàn toàn miễn phí, Groq và OpenRouter là lựa chọn thay thế tốt nhất.

Dữ liệu gửi qua API miễn phí có bị dùng để train model không?

Chính sách khác nhau theo provider: Google AI Studio có thể dùng dữ liệu free tier để cải thiện model (trừ khi bạn opt-out trong cài đặt). Groq và Cerebras thường không train trên dữ liệu của người dùng. OpenRouter tuân theo chính sách của từng provider model. Với dữ liệu nhạy cảm, hãy đọc kỹ Privacy Policy hoặc dùng self-hosted model qua Ollama.

Có thể dùng nhiều provider cùng lúc trong một agent không?

Hoàn toàn có thể. Vì tất cả provider trong danh sách này đều tương thích OpenAI SDK format (chỉ cần đổi base_url và api_key), việc xây dựng routing layer rất đơn giản.

Ollama và self-hosted model có nên dùng song song không?

Rất nên. Ollama cho phép chạy model cục bộ hoàn toàn miễn phí và không giới hạn, phù hợp làm fallback cuối cùng khi tất cả free tier API đều hết quota. Nhược điểm là cần phần cứng đủ mạnh (ít nhất 16GB RAM cho model 7B, 32GB+ cho 70B) và tốc độ thường chậm hơn cloud provider.

Đông Tùng

Senior Technology Writer

Là cử nhân Quản trị kinh doanh của Trường Đại học Tài chính - Marketing, Tùng bắt đầu làm việc tại Tino Group từ năm 2021 ở vị trí Content Marketing để thỏa mãn niềm đam mê viết lách của bản thân. Sở hữu khả năng sáng tạo đặc biệt, anh cùng đội ngũ của mình đã tạo nên những chiến dịch quảng cáo độc đáo cùng vô số bài viết hữu ích về nhiều chủ đề khác nhau. Sự tỉ mỉ, kiên trì và tinh thần sáng tạo của Tùng đã góp phần lớn vào thành công của Tino Group trong lĩnh vực marketing trực tuyến.

Xem thêm bài viết

Bài viết liên quan