← Writing

ai-weekly · Vietnamese · 9 phút

🇺🇸 Read in English

AI Tuần W28/2026: Agent tự viết lại kỹ năng và làn sóng mô hình giá rẻ thách thức frontier

July 7, 2026

Lưu trữ · tuần 28/2026

Tuần 28/2026: Memento-Skills cho phép agent tự cải thiện kỹ năng mà không cần huấn luyện lại mô hình gốc — trong khi MiniMax-M3 đạt hiệu năng vượt GPT-5.5 và Gemini 3.1 Pro với chi phí chỉ bằng 5–10%.

Tuần 28/2026 đặt ra hai câu hỏi then chốt cho người làm AI: liệu agent có thể tự cải thiện mà không cần chạm vào trọng số mô hình (model weights) không, và hiệu năng frontier có còn xứng với mức giá premium khi MiniMax-M3 vượt GPT-5.5 và Gemini 3.1 Pro chỉ với 5–10% chi phí?

Câu trả lời từ nghiên cứu và sản phẩm tuần này đều hướng về cùng một điểm: kiến trúc AI đang được tách rời — hành vi của agent (kỹ năng, chiến lược) được tách khỏi trọng số mô hình cố định, cho phép cải thiện liên tục mà không cần huấn luyện lại từ đầu. Memento-Skills lưu kỹ năng trong bộ nhớ ngoài có thể cập nhật; Agent-R1 mở rộng học tăng cường (reinforcement learning) sang các tác vụ đa bước thực tế; Tencent Hy3 và MiniMax-M3 tiếp tục thu hẹp khoảng cách giữa mô hình rẻ và mô hình frontier. Tại Nhật, CyberAgent xác nhận mô hình ngôn ngữ lớn (LLM) nội địa đã hoạt động trong môi trường sản xuất. Tại Việt Nam, cộng đồng Viblo đang đặt câu hỏi ngày càng sắc bén hơn về vai trò của mô hình ngôn ngữ nhỏ (Small Language Model) và giao thức kết nối công cụ trong thiết kế hệ thống agent.


Dòng thời gian tuần này

NgàySự kiện
07 Th7MIT Technology Review: Kiến trúc nền tảng để triển khai AI agent ở quy mô enterprise

Góc Nhìn Biên Tập

Agent tự viết lại kỹ năng của mình — không cần huấn luyện lại mô hình gốc VentureBeat · Tháng 7/2026

Nhóm nghiên cứu từ nhiều trường đại học giới thiệu Memento-Skills — khung (framework) cho phép agent dựa trên LLM sở hữu một kho kỹ năng bên ngoài, có thể thêm, cập nhật, và loại bỏ kỹ năng dựa trên phản hồi từ môi trường mà không động đến trọng số mô hình gốc.

Hãy hình dung một kỹ sư sau mỗi dự án lại ghi chú "bài học" vào một cuốn sổ riêng, rồi tra cuốn sổ đó trong các dự án tiếp theo. Memento-Skills hoạt động đúng như vậy: sau mỗi lần chạy, agent đánh giá cách tiếp cận của mình, viết lại hoặc bổ sung kỹ năng vào thư viện ngoài, rồi truy cập thư viện đã cải thiện ở lần chạy kế. Không có cập nhật gradient, không cần GPU cho tinh chỉnh (fine-tuning). Kết quả cho thấy hiệu suất tác vụ cải thiện dần qua các vòng tương tác mà không có bất kỳ bước huấn luyện bổ sung sau (post-training) nào.

Tại sao đây là Góc Nhìn Biên Tập tuần này: Memento-Skills giải quyết một trong những nút thắt cốt lõi khi xây agent tự cải thiện thực tế — chi phí và sự bất ổn của việc huấn luyện lại mô hình mỗi khi cần thay đổi hành vi. Đây là mẫu kiến trúc cụ thể nhất tuần này cho ai theo dõi nghiên cứu về self-improving agents và hệ thống đa tác nhân (multi-agent): tách rời kiến thức có thể cập nhật khỏi mô hình cố định.


Câu chuyện tuần này

Nguồn tiếng Anh

MiniMax-M3: vượt GPT-5.5 và Gemini 3.1 Pro với 5–10% chi phí VentureBeat · Tháng 7/2026

Startup AI Trung Quốc MiniMax phát hành M3 — mô hình với cửa sổ ngữ cảnh 1 triệu token, đa phương thức gốc, đạt 59.0% trên SWE-Bench Pro (bộ bài kiểm tra chuẩn cho agent lập trình tự động) — vượt cả GPT-5.5 lẫn Gemini 3.1 Pro trên các bộ bài kiểm tra chính. Chi phí suy luận (inference) ước tính chỉ bằng 5–10% của hai mô hình trên.

Tại sao quan trọng: Sự dịch chuyển giá–hiệu năng từ các lab Trung Quốc tiếp tục tăng tốc sau W26 (GLM-5.2, MiniMax M2.5). Nếu đội ngũ của bạn đang trả chi phí premium cho GPT-5.5 trên các tác vụ lập trình hay suy luận, kiểm tra M3 ngay bây giờ là quyết định có trách nhiệm với ngân sách.


Agent-R1: khung học tăng cường cho tác vụ agent đa bước trong thực tế VentureBeat · Tháng 7/2026

Nhóm nghiên cứu từ Đại học Khoa học và Công nghệ Trung Quốc phát hành Agent-R1 mã nguồn mở — nền tảng học tăng cường (reinforcement learning) mở rộng từ RL một lượt (dùng trong các bộ bài kiểm tra toán và lập trình) sang môi trường đa bước, tương tác. Khung giải quyết hai thách thức chính: gán tín dụng (credit assignment) khi agent thực hiện chuỗi hành động qua nhiều trạng thái môi trường, và mô hình hóa phần thưởng (reward modeling) cho các tác vụ không có đáp án đơn lẻ rõ ràng.

Tại sao quan trọng: Hầu hết nghiên cứu tinh chỉnh bằng RL chỉ áp dụng cho bài toán đơn lượt. Agent-R1 mở ra hướng huấn luyện agent trên các tác vụ thực tế phức tạp — sử dụng công cụ, điều hướng web, suy luận nhiều bước.


Tencent Hy3: Apache 2.0, nửa kích thước, vượt GLM-5.2 ở hầu hết benchmark VentureBeat · Tháng 7/2026

Tencent phát hành Hy3 dưới giấy phép Apache 2.0 — mô hình vượt GLM-5.2 của Zhipu AI trên hầu hết bộ bài kiểm tra dù chỉ có khoảng một nửa số tham số; ngoại lệ là các tác vụ lập trình nơi GLM-5.2 vẫn dẫn trước. Giấy phép Apache 2.0 biến Hy3 thành một trong những mô hình Trung Quốc cạnh tranh nhất có thể dùng tự do cho sản phẩm thương mại.

Tại sao quan trọng: Thêm một mô hình chất lượng cao với giấy phép mở từ lab lớn Trung Quốc, dành cho đội ngũ cần cân bằng giữa hiệu năng và tự do thương mại mà không muốn phụ thuộc vào API đóng.


Claude Sonnet 5 ra mắt; Anthropic Fable trở lại toàn cầu The Rundown · Tháng 7/2026

Anthropic phát hành Claude Sonnet 5, phiên bản mới nhất trong dòng Claude 5 ở phân khúc mid-tier. Song song đó, Fable — sản phẩm AI kể chuyện của Anthropic trước đó bị hạn chế về địa lý — đã được cơ quan quản lý Mỹ cho phép hoạt động toàn cầu trở lại.

Tại sao quan trọng: Sonnet là phân khúc Claude được dùng nhiều nhất trong môi trường sản xuất. Các đội ngũ đang chạy pipeline với Sonnet 4.6 nên kiểm tra chất lượng và chi phí của Sonnet 5 để quyết định có nên nâng cấp không.


Nền tảng kiến trúc AI để triển khai ở quy mô enterprise MIT Technology Review · 07 Th7 2026

MIT Technology Review phác thảo khung kiến trúc cần thiết để triển khai hệ thống AI tích hợp đáng tin cậy ở quy mô doanh nghiệp, tập trung vào hệ thống agent. Bài xác định bốn trụ cột mà các tổ chức thất bại trong các AI pilot đều nhìn lại và thấy thiếu: lớp điều phối (orchestration), pipeline dữ liệu, quản lý phiên bản mô hình, và khả năng quan sát (observability).

Tại sao quan trọng: Quyết định kiến trúc sớm trong hệ thống agent tạo ra nền tảng có thể mở rộng hoặc nợ kỹ thuật đắt đỏ. Khung này hữu ích cho bất kỳ đội ngũ nào đang xây dựng vượt ra ngoài mức suy luận đơn mô hình.


Nguồn Nhật Bản

CyberAgent công bố LLM nội địa: từ nội bộ ra công chúng Nikkei Xtech · Tháng 7/2026

CyberAgent — một trong những công ty internet tiêu dùng lớn nhất Nhật Bản — phát hành công khai LLM tự phát triển sau khi đã xác nhận hiệu quả trong hoạt động kinh doanh nội bộ. Đây không phải mô hình nghiên cứu thực nghiệm: mô hình đã được xác nhận hoạt động trong môi trường sản xuất trước khi chia sẻ ra bên ngoài.

Tại sao quan trọng: Một LLM nội địa được xác nhận trong sản xuất từ công ty internet lớn là tín hiệu rõ về sự trưởng thành của hạ tầng AI doanh nghiệp Nhật — chuyển dần từ phụ thuộc vào API Mỹ sang mô hình tùy chỉnh trong nhà. Điều này ảnh hưởng đến cách các công ty Nhật và châu Á khác đánh giá chiến lược AI của mình.


AI tổng quát có nuốt chửng ML truyền thống không? Qiita · Tháng 7/2026 · bài viết cộng đồng

Phân tích cộng đồng Qiita xem xét liệu AI tổng quát (LLM và hệ sinh thái GenAI) có đang thay thế các luồng công việc học máy (ML) truyền thống không. Tác giả lập bản đồ cụ thể: nơi LLM đang thay thế ML cổ điển (phân loại văn bản, trích xuất đặc trưng qua câu lệnh hướng dẫn — prompt) và nơi ML có cấu trúc vẫn không thể thiếu (dự đoán dữ liệu bảng, dự báo sản xuất, hệ thống yêu cầu khả năng giải thích). Kết luận: sự dịch chuyển phụ thuộc vào lĩnh vực cụ thể, không phải thay thế toàn diện.

Tại sao quan trọng với DS ở Việt Nam: Đây là bản đồ tư duy thực tế để định hướng kỹ năng — kỹ năng ML nào vẫn có giá trị dài hạn và kỹ năng nào đang bị GenAI hàng hóa hóa? Câu hỏi này không chỉ liên quan đến kỹ sư Nhật.


LLM cho phân tích chuỗi thời gian: thực nghiệm từ Loglass Zenn · Tháng 7/2026 · bài viết cộng đồng

Kỹ sư tại Loglass — công ty SaaS kinh doanh thông minh của Nhật — ghi lại thực nghiệm áp dụng LLM cho các tác vụ phân tích chuỗi thời gian (time series) trong sản xuất. Bài bao gồm cách thiết kế câu lệnh hướng dẫn (prompt engineering) cho phép LLM suy luận trên dữ liệu chuỗi thời gian không cần mô hình ARIMA hay LSTM, đồng thời thảo luận về nơi phân tích dựa trên LLM vượt trội và nơi nó thất bại so với phương pháp thống kê cổ điển.

Tại sao quan trọng: Góc nhìn thực hành từ đội ngũ kỹ thuật sản xuất thực tế cắt qua nhiễu quảng cáo — hữu ích cho các đội DS đang đánh giá liệu có nên áp dụng phân tích dựa trên LLM thay cho các mô hình thống kê baseline.


Nguồn Việt Nam

So sánh 10 nhà cung cấp LLM API hàng đầu năm 2026 Viblo · Tháng 7/2026

Bài Viblo so sánh có cấu trúc 10 nhà cung cấp API LLM năm 2026, phân thành bốn nhóm: nhà cung cấp gốc (OpenAI, Anthropic, Google), nơi host mã nguồn mở (Together AI, Fireworks), lớp định tuyến (OpenRouter), và nhà cung cấp đám mây (AWS Bedrock, Azure OpenAI). Mỗi nhà cung cấp được đánh giá theo giá/triệu token, độ trễ, cửa sổ ngữ cảnh, và độ rộng lựa chọn mô hình.

Tại sao quan trọng: Chênh lệch giá giữa các nhà cung cấp hiện có thể vượt 100 lần — chọn nhà cung cấp API là quyết định kỹ thuật có ý nghĩa, không còn là chi tiết phụ. Bài này cho cộng đồng Việt Nam một khung so sánh có hệ thống, đặc biệt khi đặt cạnh sự xuất hiện của M3 và Hy3 trong tuần này.


SLM — mảnh ghép còn thiếu của kỷ nguyên Agentic AI Viblo · Tháng 7/2026

Bài Viblo lập luận rằng mô hình ngôn ngữ nhỏ (Small Language Model — SLM, thường dưới 10B tham số) là thành phần còn thiếu trong kiến trúc AI agentic — không phải để thay thế mô hình lớn mà là bộ suy luận nhanh cho các tác vụ phụ không cần năng lực đầy đủ của LLM. Tác giả dẫn các trường hợp dùng SLM cho định tuyến, lọc, và trích xuất có cấu trúc trong khi LLM đảm nhận phần sinh văn bản phức tạp.

Tại sao quan trọng: Với các đội xây hệ thống đa tác nhân (multi-agent), SLM là hướng tối ưu hóa chi phí và độ trễ cụ thể — chạy mô hình phù hợp cho từng tác vụ thay vì định tuyến tất cả qua mô hình frontier đắt tiền. Luận điểm này khớp với Memento-Skills: cả hai đều đặt câu hỏi về việc phân tách trách nhiệm trong hệ thống agent.


Model Context Protocol: giao thức ngữ cảnh cho mô hình AI hiện đại Viblo · Tháng 7/2026

Bài Viblo giải thích Model Context Protocol (MCP) của Anthropic — chuẩn mở để kết nối LLM với nguồn dữ liệu và công cụ bên ngoài theo cách chuẩn hóa. Bài bao gồm kiến trúc host-client-server của MCP và cung cấp ví dụ thực tế kết nối LLM với cơ sở dữ liệu cục bộ và REST API.

Tại sao quan trọng: MCP đang nhanh chóng trở thành lớp tích hợp chuẩn cho hệ thống agent AI trong sản xuất — hướng dẫn tiếng Việt này hạ thấp rào cản áp dụng cho cộng đồng lập trình viên trong nước, đặc biệt khi chính Anthropic vừa ra mắt Claude Sonnet 5 trong cùng tuần.


Xu hướng tuần này

  • Tách rời hành vi agent khỏi trọng số mô hình. Memento-Skills (kỹ năng bên ngoài có thể cập nhật), Agent-R1 (học tăng cường cho tác vụ đa bước), và luận điểm về SLM từ cộng đồng Viblo đều chỉ về cùng một hướng: kiến trúc AI tốt nhất là kiến trúc phân tách điều có thể thay đổi (hành vi, chiến lược, công cụ) khỏi điều không thể thay đổi dễ dàng (trọng số mô hình gốc). Đây là xu hướng thiết kế xuyên suốt tuần này, từ nghiên cứu đến framework thực tế.

  • Mô hình giá rẻ đang làm lại câu hỏi "mô hình nào đáng tiền?". MiniMax-M3 ở 5–10% chi phí GPT-5.5 và Gemini 3.1 Pro, Tencent Hy3 vượt GLM-5.2 với nửa số tham số và giấy phép Apache 2.0, CyberAgent LLM nội địa xác nhận trong sản xuất tại Nhật — ba tín hiệu trong cùng một tuần cho thấy hiệu năng frontier không còn là đặc quyền của mô hình đắt tiền. Xu hướng này bắt đầu từ W26 và đang tăng tốc.

  • Enterprise AI cần kiến trúc, không chỉ mô hình. Bài MIT Technology Review về kiến trúc nền tảng khớp với tín hiệu từ Nhật (LLM nội địa trong sản xuất) và từ cộng đồng agent (Agent-R1, Memento-Skills): chọn đúng mô hình chỉ là một phần câu trả lời — orchestration, data pipeline, observability, và thiết kế failure mode là phần quyết định thành bại trong triển khai thực tế.


Tuần tới sẽ đáng chú ý xem liệu cộng đồng mã nguồn mở có benchmark độc lập MiniMax-M3 để xác nhận các con số từ VentureBeat không — và liệu Memento-Skills có được tích hợp vào các framework agent phổ biến như LangGraph hay AutoGen trong thời gian gần không.

ai-weekly2026self-improving-agentsopen-sourcellm

Nguồn tham khảo

  1. CyberAgent ra mắt LLM nội địa — Nikkei Xtech
  2. Generative AI có nuốt chửng ML không? — Qiita
  3. LLM cho phân tích chuỗi thời gian — Zenn (Loglass)
  4. So sánh 10 nhà cung cấp LLM API 2026 — Viblo
  5. Small Language Models — Mảnh ghép còn thiếu của kỷ nguyên Agentic AI — Viblo
  6. Model Context Protocol — Viblo
  7. MiniMax-M3 debuts, eclipsing GPT-5.5 and Gemini 3.1 Pro — VentureBeat
  8. Memento-Skills: AI agents rewrite their own skills without retraining — VentureBeat
  9. Agent-R1: RL framework for complex agentic tasks — VentureBeat
  10. Tencent Hy3 beats GLM-5.2 at half the size — VentureBeat
  11. Claude Sonnet 5 ships; Fable returns worldwide — The Rundown
  12. Foundational elements of AI architecture for enterprise scale — MIT Technology Review