Agents Learn Soccer Skills
Áp dụng học sâu tăng cường để tổng hợp các kỹ năng đá bóng linh hoạt cho một rô-bốt hình người thu nhỏ; kết quả thu được cho phép thực hiện các kỹ năng di chuyển năng động như phục hồi nhanh, đi bộ và đá bóng.
Link: https://dpmd.ai/41N3CsM
Scaling Transformer to 1M tokens with RMT
Mở rộng quy mô Transformer lên 1 triệu tokens và hơn thế nữa với RMT
Bằng cách tận dụng kiến trúc Recurrent Memory Transformer, nhóm nghiên cứu đã tăng thành công độ dài bối cảnh hiệu quả của mô hình lên hai triệu tokens. Đây là một con số chưa từng có.
Link: https://arxiv.org/abs/2304.11062
Track Anything: Segment Anything Meets Videos
Track-Anything là một công cụ tương tác và linh hoạt để theo dõi và phân đoạn đối tượng video.
Track Anything phù hợp với:
- Theo dõi và phân đoạn đối tượng video với các thay đổi của cảnh quay.
- Phát triển trực quan và chú thích dữ liệu để theo dõi và phân đoạn đối tượng video.
- Các tác vụ video hướng xuống tập trung vào đối tượng, chẳng hạn như vẽ và chỉnh sửa video.
abs: https://arxiv.org/abs/2304.11968
github: https://github.com/gaomingqi/Track-Anything
A Cookbook of Self-Supervised Learning
Học tự giám sát là nền tảng cho công việc tiên tiến ngày nay về ngôn ngữ tự nhiên, thị giác máy tính, v.v. — nhưng đó là một nghệ thuật phức tạp với nhiều rào cản gia nhập.
Meta AI đã phát hành SSL Cookbook, một hướng dẫn thiết thực để điều hướng SSL + đóng góp cho không gian này.
Link: https://ai.facebook.com/blog/self-supervised-learning-practical-guide/
Harnessing the Power of LLMs
Một hướng dẫn thực tế và toàn diện cho các học viên làm việc với LLM.
Thảo luận về nhiều trường hợp sử dụng với các ứng dụng thực tế và hạn chế của LLM trong các tình huống thực tế.
Link: https://arxiv.org/abs/2304.13712
AudioGPT
AudioGPT – kết nối ChatGPT với các mô hình nền tảng âm thanh
Paper mới này đề xuất AudioGPT, kết nối ChatGPT với các mô hình nền tảng âm thanh để xử lý các tác vụ âm thanh đầy thách thức và giao diện chuyển đổi phương thức để cho phép đối thoại bằng giọng nói.
Link: https://arxiv.org/abs/2304.12995
DataComp
DataComp – một tiêu chuẩn mới cho bộ dữ liệu đa phương thức!
DataComp phát hành 12,8 tỷ cặp hình ảnh-văn bản, hơn 300 thử nghiệm và một tập con 1,4 tỷ subset.
Paper: http://arxiv.org/abs/2304.14108
Github: https://github.com/mlfoundations/datacomp
Website: http://datacomp.ai
ChatGPT for Information Extraction
Một trong những ứng dụng chính của ChatGPT mà chúng ta biết là khai thác thông tin.
Bài báo này cung cấp một đánh giá sâu hơn về hiệu suất của ChatGPT trong nhiệm vụ quan trọng này.
Link: arxiv.org/abs/2304.11633
Comparing Physicians vs ChatGPT
Nghiên cứu này điều tra xem ChatGPT có thể cung cấp câu trả lời chất lượng cho các câu hỏi của bệnh nhân hay không
Kết quả cho thấy rằng phản hồi của chatbot được ưa thích hơn phản hồi của bác sĩ và được đánh giá cao hơn về cả chất lượng và sự đồng cảm.
Link: https://jamanetwork.com/journals/jamainternalmedicine/fullarticle/2804309
Stable and Low-Precision Training for Large-Scale Vision-Language Models
Nghiên cứu này giới thiệu các phương pháp để tăng tốc và ổn định việc đào tạo các mô hình thị giác ngôn ngữ quy mô lớn.
