Agents Learn Soccer Skills

Áp dụng học sâu tăng cường để tổng hợp các kỹ năng đá bóng linh hoạt cho một rô-bốt hình người thu nhỏ; kết quả thu được cho phép thực hiện các kỹ năng di chuyển năng động như phục hồi nhanh, đi bộ và đá bóng.

Link: https://dpmd.ai/41N3CsM

Scaling Transformer to 1M tokens with RMT

Mở rộng quy mô Transformer lên 1 triệu tokens và hơn thế nữa với RMT

Bằng cách tận dụng kiến trúc Recurrent Memory Transformer, nhóm nghiên cứu đã tăng thành công độ dài bối cảnh hiệu quả của mô hình lên hai triệu tokens. Đây là một con số chưa từng có.

Link: https://arxiv.org/abs/2304.11062

Track Anything: Segment Anything Meets Videos

Track-Anything là một công cụ tương tác và linh hoạt để theo dõi và phân đoạn đối tượng video.

Track Anything phù hợp với:

  • Theo dõi và phân đoạn đối tượng video với các thay đổi của cảnh quay.
  • Phát triển trực quan và chú thích dữ liệu để theo dõi và phân đoạn đối tượng video.
  • Các tác vụ video hướng xuống tập trung vào đối tượng, chẳng hạn như vẽ và chỉnh sửa video.

abs: https://arxiv.org/abs/2304.11968
github: https://github.com/gaomingqi/Track-Anything

A Cookbook of Self-Supervised Learning

Học tự giám sát là nền tảng cho công việc tiên tiến ngày nay về ngôn ngữ tự nhiên, thị giác máy tính, v.v. — nhưng đó là một nghệ thuật phức tạp với nhiều rào cản gia nhập.

Meta AI đã phát hành SSL Cookbook, một hướng dẫn thiết thực để điều hướng SSL + đóng góp cho không gian này.

Link: https://ai.facebook.com/blog/self-supervised-learning-practical-guide/

Harnessing the Power of LLMs

Một hướng dẫn thực tế và toàn diện cho các học viên làm việc với LLM.

Thảo luận về nhiều trường hợp sử dụng với các ứng dụng thực tế và hạn chế của LLM trong các tình huống thực tế.

Link: https://arxiv.org/abs/2304.13712

AudioGPT

AudioGPT – kết nối ChatGPT với các mô hình nền tảng âm thanh

Paper mới này đề xuất AudioGPT, kết nối ChatGPT với các mô hình nền tảng âm thanh để xử lý các tác vụ âm thanh đầy thách thức và giao diện chuyển đổi phương thức để cho phép đối thoại bằng giọng nói.

Link: https://arxiv.org/abs/2304.12995

DataComp

DataComp – một tiêu chuẩn mới cho bộ dữ liệu đa phương thức!

DataComp phát hành 12,8 tỷ cặp hình ảnh-văn bản, hơn 300 thử nghiệm và một tập con 1,4 tỷ subset.

Paper: http://arxiv.org/abs/2304.14108

Github: https://github.com/mlfoundations/datacomp

Website: http://datacomp.ai

ChatGPT for Information Extraction

Một trong những ứng dụng chính của ChatGPT mà chúng ta biết là khai thác thông tin.

Bài báo này cung cấp một đánh giá sâu hơn về hiệu suất của ChatGPT trong nhiệm vụ quan trọng này.

Link: arxiv.org/abs/2304.11633

Comparing Physicians vs ChatGPT

Nghiên cứu này điều tra xem ChatGPT có thể cung cấp câu trả lời chất lượng cho các câu hỏi của bệnh nhân hay không

Kết quả cho thấy rằng phản hồi của chatbot được ưa thích hơn phản hồi của bác sĩ và được đánh giá cao hơn về cả chất lượng và sự đồng cảm.

Link: https://jamanetwork.com/journals/jamainternalmedicine/fullarticle/2804309

Stable and Low-Precision Training for Large-Scale Vision-Language Models

Nghiên cứu này giới thiệu các phương pháp để tăng tốc và ổn định việc đào tạo các mô hình thị giác ngôn ngữ quy mô lớn.

Paper: https://arxiv.org/abs/2304.13013

Colab: https://github.com/mlfoundations/open_clip/blob/db53d2702adf426b8b3f6748cb7ef231a08ab027/tutorials/int8_tutorial.ipynb


Gửi phản hồi

Khám phá thêm từ AI Era

Đăng ký ngay để tiếp tục đọc và truy cập kho lưu trữ đầy đủ.

Tiếp tục đọc