Hướng dẫn · 6 phút đọc

Bên trong MinuteAI: Bản ghi âm không bao giờ rời khỏi Mac hay iPhone của bạn

MinuteAI chuyển các cuộc họp, phỏng vấn và ghi chú giọng nói thành văn bản hoàn toàn trên thiết bị — quy trình mô hình, giới hạn bộ nhớ, và vì sao không có gì chạm vào máy chủ.

Bên trong MinuteAI: Bản ghi âm không bao giờ rời khỏi Mac hay iPhone của bạn

Bản ghi âm thường đi về đâu

Hầu hết các ứng dụng phiên âm khi được yêu cầu chuyển một bản ghi âm cuộc họp thành văn bản đều xử lý ở một nơi hoàn toàn khác: âm thanh của bạn được tải lên, một máy chủ nào đó xử lý nó, rồi bản phiên âm được trả về sau vài giây hoặc vài phút. Với một ghi chú giọng nói thông thường, đó chỉ là bất tiện nhỏ. Nhưng với một cuộc họp khách hàng, một bản ghi âm liên quan đến pháp lý, hay một cuộc phỏng vấn với người tưởng rằng cuộc trò chuyện là riêng tư, câu hỏi đặt ra lớn hơn nhiều — đoạn âm thanh đó vừa đi đâu, và ai khác có thể xem được nó?

MinuteAI được xây dựng xoay quanh một câu trả lời khác: không đi đâu cả. Đây là ứng dụng phiên âm AI cục bộ ưu tiên quyền riêng tư cho macOS và iOS, chuyển các cuộc họp, phỏng vấn và ghi chú giọng nói thành văn bản được xử lý hoàn toàn trên thiết bị của bạn — không có hành trình khứ hồi lên đám mây, không theo dõi, và không có máy chủ nào từng nhìn thấy âm thanh của bạn.

MinuteAI thực sự làm gì

MinuteAI là ứng dụng gốc cho macOS và iOS, được xây dựng bằng SwiftUI, và chạy AI trên thiết bị thông qua CoreML — framework của Apple để chạy các mô hình học máy hiệu quả trên Apple Silicon. Trên thực tế, điều đó có nghĩa là:

  • Phiên âm trên thiết bị — âm thanh được phiên âm cục bộ, không tải lên bất kỳ API phiên âm nào
  • Suy luận bằng CoreML — các mô hình chạy qua Apple Neural Engine thay vì một cụm GPU từ xa
  • Không phụ thuộc đám mây — ứng dụng hoạt động mà không cần kết nối internet, vì bản thân việc xử lý chưa bao giờ cần đến nó
  • Ứng dụng gốc cho macOS và iOS — không phải một lớp bọc web view, mà là một ứng dụng SwiftUI đúng nghĩa trên cả hai nền tảng

Ứng dụng có thể tải xuống miễn phí, và toàn bộ tôn chỉ nằm gọn trong một câu mô tả sản phẩm: không đám mây, không theo dõi, chỉ có sự riêng tư thuần túy.

Quy trình xử lý bên dưới

Chúng tôi đã viết về kiến trúc đằng sau loại ứng dụng này theo cách tổng quát hơn trong bài Xây dựng ứng dụng AI ưu tiên quyền riêng tư trên macOS, và MinuteAI chính là sản phẩm cụ thể mà kiến trúc đó mô tả. Nói ngắn gọn: một Model Manager tải xuống, lưu cache, và nạp các mô hình ML cục bộ; một pipeline xử lý nối âm thanh vào bước phiên âm rồi đến các bước hậu xử lý như tóm tắt; và một kho lưu kết quả — dựa trên SQLite, có tìm kiếm toàn văn — giữ mọi thứ có thể truy vấn được mà không cần gọi mạng. Core ML đảm nhận mô hình phiên âm dựa trên Whisper, trong khi GGUF (thông qua llama.cpp) vận hành các tính năng dựa trên LLM như tóm tắt, vì hai khối lượng công việc này có đặc tính hiệu năng khác nhau và mỗi loại được hưởng lợi từ một runtime riêng.

Bộ nhớ mới là ràng buộc thực sự

Chạy mô hình AI cục bộ đồng nghĩa với việc đánh đổi một vấn đề về quyền riêng tư lấy một vấn đề về quản lý tài nguyên. Một mô hình Whisper Large cần khoảng 3GB RAM để chạy — không hề nhỏ trên điện thoại, và cũng không miễn phí ngay cả trên một chiếc Mac có nhiều bộ nhớ dư thừa. Cách xử lý thực tế cho ràng buộc này định hình phần lớn hành vi của ứng dụng ở phía dưới: mô hình được nạp lười biếng (lazy) — chỉ khi bạn thực sự kích hoạt một lượt phiên âm — và tự động được gỡ khỏi bộ nhớ sau 60 giây không hoạt động, thay vì nằm thường trực trong bộ nhớ vô thời hạn. Trọng số mô hình được đọc qua các file ánh xạ bộ nhớ (memory-mapped) thay vì nạp toàn bộ vào RAM ngay từ đầu, và ứng dụng theo dõi os_proc_available_memory() để giảm cấp một cách nhẹ nhàng thay vì bị crash khi bộ nhớ trở nên eo hẹp.

Không điều gì trong số đó hiện ra trước mắt người dùng mở ứng dụng lên để phiên âm một ghi chú giọng nói. Nhưng đó chính là sự khác biệt giữa một ứng dụng chạy ổn định trên một chiếc iPhone cấu hình cơ bản, và một ứng dụng chỉ hoạt động tốt trên phần cứng cao cấp của chính người phát triển.

Vì sao điều này đặc biệt quan trọng với phiên âm

Phiên âm là một hạng mục mà mức độ rủi ro về quyền riêng tư cao hơn hầu hết các trường hợp sử dụng AI khác, bởi vì đầu vào gần như luôn là giọng nói thật của ai đó, nói những điều mà họ không hẳn đã lên kế hoạch để bên thứ ba phiên âm lại. Các bản ghi âm cuộc họp thường chứa những thông tin mà không ai có ý định đưa vào email. Các cuộc phỏng vấn ghi lại những điều người ta nói ngoài lề, không chính thức. Ghi chú giọng nói, theo đúng định nghĩa, là thứ mang tính cá nhân. Việc xử lý điều đó trên thiết bị không phải là một tính năng phụ thêm cho có — nó thay đổi những gì MinuteAI được phép dùng để làm, vì không có bước tải lên nào để chính sách bảo mật của một công ty phải cân nhắc.

Vị trí của MinuteAI trong hệ sản phẩm

MinuteAI chia sẻ nguyên tắc cốt lõi — dữ liệu không bao giờ rời khỏi thiết bị — với phần còn lại của hệ sản phẩm AityTech. PrivateAI áp dụng cùng nguyên tắc đó cho một tập hợp công cụ chạy trên trình duyệt thay vì ứng dụng gốc. Legacy Dragon áp dụng nó vào việc phân tích mã nguồn legacy cục bộ thay vì gửi lên dịch vụ đám mây. Yomite áp dụng nó vào việc đọc văn bản tiếng Nhật offline. Các bài toán khác nhau, nhưng điều không thể thương lượng thì luôn giống nhau: không đòi hỏi nhiều sự tin tưởng hay dữ liệu hơn mức công việc thực sự cần.


MinuteAI hiện đã có trên App Store cho macOS và iOS, hoặc bạn có thể tìm hiểu thêm tại getminute.app. Có câu hỏi về cách nó phù hợp với quy trình làm việc của bạn? Hãy liên hệ [email protected].

Xem sản phẩm của chúng tôi

Từ MinuteAI đến AgentKits — khám phá các sản phẩm và dự án chúng tôi đã triển khai.

Xem danh mục

Bài viết liên quan