Article 15 Your Inference Server is Secretly a Learner: Reef Infrastructure for Continual Self-Improving Agents
Natural Language Reinforcement Learning Natural Language Reinforcement Learning Paper • 2411.14251 • Published Nov 21, 2024 • 30 Benjamin-eecs/Llama-3.1-8B-Instruct-NLRL-TicTacToe-Value Feature Extraction • 8B • Updated Nov 24, 2024 • 18 Benjamin-eecs/Llama-3.1-8B-Instruct-NLRL-TicTacToe-Policy Feature Extraction • 8B • Updated Nov 24, 2024 • 20 Waterhorse/Llama-3.1-8B-Instruct-NLRL-Breakthrough-Value Feature Extraction • 8B • Updated Nov 24, 2024 • 22
Benjamin-eecs/Llama-3.1-8B-Instruct-NLRL-TicTacToe-Value Feature Extraction • 8B • Updated Nov 24, 2024 • 18
Benjamin-eecs/Llama-3.1-8B-Instruct-NLRL-TicTacToe-Policy Feature Extraction • 8B • Updated Nov 24, 2024 • 20
Waterhorse/Llama-3.1-8B-Instruct-NLRL-Breakthrough-Value Feature Extraction • 8B • Updated Nov 24, 2024 • 22
Natural Language Reinforcement Learning Natural Language Reinforcement Learning Paper • 2411.14251 • Published Nov 21, 2024 • 30 Benjamin-eecs/Llama-3.1-8B-Instruct-NLRL-TicTacToe-Value Feature Extraction • 8B • Updated Nov 24, 2024 • 18 Benjamin-eecs/Llama-3.1-8B-Instruct-NLRL-TicTacToe-Policy Feature Extraction • 8B • Updated Nov 24, 2024 • 20 Waterhorse/Llama-3.1-8B-Instruct-NLRL-Breakthrough-Value Feature Extraction • 8B • Updated Nov 24, 2024 • 22
Benjamin-eecs/Llama-3.1-8B-Instruct-NLRL-TicTacToe-Value Feature Extraction • 8B • Updated Nov 24, 2024 • 18
Benjamin-eecs/Llama-3.1-8B-Instruct-NLRL-TicTacToe-Policy Feature Extraction • 8B • Updated Nov 24, 2024 • 20
Waterhorse/Llama-3.1-8B-Instruct-NLRL-Breakthrough-Value Feature Extraction • 8B • Updated Nov 24, 2024 • 22
Benjamin-eecs/Llama-3.1-8B-Instruct-NLRL-TicTacToe-Policy Feature Extraction • 8B • Updated Nov 24, 2024 • 20
Benjamin-eecs/Llama-3.1-8B-Instruct-NLRL-TicTacToe-Value Feature Extraction • 8B • Updated Nov 24, 2024 • 18