Pith. sign in

Paper Citation Record · LEDGER

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

As of 19 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 12 inbound Pith citation observations for arXiv:2505.04623.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.04623 v1

Coverage vector

measured 38 of 38 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T23:27:27.827281Z

measured 50 of 50 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-19T06:32:44.657259+00:00

measured 12 of 12 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:31:13.645079Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-22T06:36:10.581673Z

Reference resolution

38 of 38 outbound references displayed

  • verified exact0
  • verified fuzzy13
  • unresolved25
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 4b583074-11a8-439f-a37f-c14b260aa7d5 · outbound

This paper cites Language Models are Few-Shot Learners.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Language Models are Few-Shot Learners

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.654416Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.654416Z digest=sha256:267c33f09a443b1c226f6a00d9d3918cdf188261ac4dd1bd44dbaebc817873b3

Observation a2a31147-77fb-4652-b64d-67a13a4d6525 · outbound

This paper cites VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.660010Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.660010Z digest=sha256:fdcc3ff7342c565a8c659029577566c823c1fa67f9bc038e3bb3ae03c510cdec

Observation 52a38cfe-52a2-4db5-b38e-7d94f9226696 · outbound

This paper cites Meerkat: Audio-visual large language model for grounding in space and time.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Meerkat: Audio-visual large language model for grounding in space and time

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T23:27:28.487046Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T23:27:27.665376Z digest=sha256:3a6a85691b893c8cb0e61228a37045425338dd9950cc3a6a4ba82f7d57b3e170

Observation d0ff539c-5fd0-4e91-aaa5-997b077ec6c6 · outbound

This paper cites Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.670138Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.670138Z digest=sha256:c7d3b1be7c1fe876baa0a58f50ee002e4fc1e42452d411ed7ea6724965bf4b78

Observation 896af91e-17e4-4d06-9681-f14ead0631b9 · outbound

This paper cites Video-R1: Reinforcing Video Reasoning in MLLMs.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Video-R1: Reinforcing Video Reasoning in MLLMs

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.675101Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.675101Z digest=sha256:7432c2b0b4d59875fd18dea1218dc8f32d26d575aaccca935b2160adbbcfddcd

Observation 81be52e9-c157-40db-9323-3d4f55f1569b · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.679804Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.679804Z digest=sha256:ca58e366eac3facadc94dfa3d9c0de671df562977ffffacf008266c64860f32d

Observation 604dcc0c-8dae-4bdc-acb1-9d2f44af38ba · outbound

This paper cites Aligned better, listen better for audio-visual large language models.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Aligned better, listen better for audio-visual large language models

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T23:27:28.473498Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T23:27:27.684961Z digest=sha256:bda60eb508246de0eb34905cf9640e01385cd3eda64b5fd14bc165347168cb55

Observation f6786f8a-ce2f-41d6-9a5c-376375de6683 · outbound

This paper cites Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.689476Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.689476Z digest=sha256:36a19f39dd8b51a6e445d078a5fa793f1e2dc3254c774968e29f308482a2fb5b

Observation a3755e8f-7520-44c5-b5b9-398597adbc9c · outbound

This paper cites Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.693947Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.693947Z digest=sha256:cec03f5d2d91f7165e381bf32c557f3a8923e75304ccb9fdc6375002d52e17b2

Observation 9deca145-4eb3-4eda-bfad-e25fc82b5eeb · outbound

This paper cites Reinforcement learning outperforms supervised fine-tuning: A case study on audio question an- swering, 2025.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Reinforcement learning outperforms supervised fine-tuning: A case study on audio question an- swering, 2025

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T23:27:28.455823Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T23:27:27.698661Z digest=sha256:e7a4e2f38766d025c8541a9f07098259ae9ff3248072bb00612b3b37850b5af9

Observation 3fd20983-66b3-40b1-9cba-1b76e40a456a · outbound

This paper cites VideoChat: Chat-Centric Video Understanding.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning VideoChat: Chat-Centric Video Understanding

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.703419Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.703419Z digest=sha256:28b207c2777aecefd0e42e9e7e8241729dd63be5c7baafdbb20a224d9cfe9dbd

Observation 4ddb042e-a39a-467e-ba8e-c519944e414a · outbound

This paper cites OmniBench: Towards the future of universal omni-language models.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning OmniBench: Towards the future of universal omni-language models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.708273Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.708273Z digest=sha256:71955469b7a695301e222f24409500fa26f03120a63fff2a517da8339ff99a02

Observation db271f2e-c079-482e-a40d-b05fe25f8bfd · outbound

This paper cites Visual-RFT: Visual Reinforcement Fine-Tuning.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Visual-RFT: Visual Reinforcement Fine-Tuning

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.712721Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.712721Z digest=sha256:91bfae12bdc9f519db20fdf49c94e09d73f0781eef4775f9423895f809da916a

Observation 3fa0bc64-62cf-4278-aafd-8ca2b1111978 · outbound

This paper cites Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.717662Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.717662Z digest=sha256:0242709c4d47ad88cff06d0f15887ec6f5f4e1d1e0ca006fa1b4fa227ddcf382

Observation cf64872e-1e45-4470-a8a4-3c4bd825e0d9 · outbound

This paper cites MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.722104Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.722104Z digest=sha256:150cf16b9b207f8217d2c90901cbe05c86ba139b12e247cafca03e6af727e799

Observation 55587098-4e55-4ebb-9224-1afc8103add8 · outbound

This paper cites ChatGPT: Optimizing language models for dia- logue.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning ChatGPT: Optimizing language models for dia- logue

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T23:27:28.441405Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T23:27:27.726796Z digest=sha256:dd746296d1d142c469582d9eec7aa0b6921239b1d45ae6ae45ee172ad3bbd886

Observation 02d9c16e-2fd3-410e-85c1-8258fcfb539a · outbound

This paper cites Introducing OpenAI o1-preview, 2024.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Introducing OpenAI o1-preview, 2024

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T23:27:28.427094Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T23:27:27.731200Z digest=sha256:29202a32f163d2973e6e4b42b4455efdcfc184b98918f121f66c4ca8dcaec1dd

Observation af057320-42e9-4ee4-b1d1-493c261e4fbd · outbound

This paper cites Training language models to follow instructions with human feedback.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Training language models to follow instructions with human feedback

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T23:27:28.412309Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T23:27:27.735755Z digest=sha256:777de7f98ceb5440914ab25bcd658b391f0f3297a33dc874b94c3c293f458d09

Observation 818984fb-e77a-47a7-a7f9-31f034ed8550 · outbound

This paper cites Robust speech recognition via large-scale weak supervision.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Robust speech recognition via large-scale weak supervision

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T23:27:28.397688Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T23:27:27.740382Z digest=sha256:4e398966c2e3f435e6178f64d7bf197e19fb583dd65d443909ae5d8e7c29c954

Observation 30d61480-77e3-40eb-a381-12f2b1ae17ec · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Direct preference optimization: Your language model is secretly a reward model

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T23:27:28.380972Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T23:27:27.744829Z digest=sha256:08e666f8162676c3a06bc2645ec7d20901148b389af84f7e955ff7c24cda321a

Observation 5f052796-5804-430d-a8eb-bd3a3f2c2dcb · outbound

This paper cites Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.749182Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.749182Z digest=sha256:81250095d9cd6f49687d4a5ba2519a287a1d9f15a64a37ee027ccc0bc85882d5

Observation e45f8923-ab84-418f-b9ef-4a0d9f455b99 · outbound

This paper cites Proximal Policy Optimization Algorithms.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Proximal Policy Optimization Algorithms

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.753728Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.753728Z digest=sha256:901544a197ae401313d221ad0367c93f99076b72c8af2720efc163313872115b

Observation 29d67698-bd4b-47bf-9fdd-7277381470ef · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.757989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.757989Z digest=sha256:552207a3ff1d334114d1e71a727349f0089d811bf4faf052af3f4cbb594436d2

Observation e7c95f25-c2f4-4215-9faf-19278f05bbc6 · outbound

This paper cites Audio-Visual LLM for Video Understanding.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Audio-Visual LLM for Video Understanding

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.762524Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.762524Z digest=sha256:e767f2c7d09247f0ca39110ad61a9105ab75b8704939be38ebb16990b2356f10

Observation 794e8067-f56a-4b2e-bde6-ff49c4c7946f · outbound

This paper cites Fine-grained Audio-Visual Joint Representations for Multimodal Large Language Models.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Fine-grained Audio-Visual Joint Representations for Multimodal Large Language Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.767079Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.767079Z digest=sha256:aad745aea6fb0fbf4185bf8fbc62a55eda787b832b89df4a2fbbf81a7d77d3e4

Observation 963ef653-9f17-4b5f-a022-d3f4d8471171 · outbound

This paper cites Hawk: Learning to understand open-world video anomalies.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Hawk: Learning to understand open-world video anomalies

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T23:27:28.364887Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T23:27:27.771876Z digest=sha256:3c92fcd22ea8395dda461fd2d9b1da1edbfb8fe686cd8b6a3b8661b02ce26cce

Observation c0f5dbda-e996-4b8e-9ae8-c033c9bea811 · outbound

This paper cites Sari: Structured audio reasoning via curriculum-guided reinforcement learning, 2025.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Sari: Structured audio reasoning via curriculum-guided reinforcement learning, 2025

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T23:27:28.350237Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T23:27:27.776637Z digest=sha256:796dfcb34999c87f02803231b9e7a3fd694d515485ef0057a78e326da7727739

Observation 2cec31b1-09f4-451e-99bf-792fb76c1a22 · outbound

This paper cites ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.781024Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.781024Z digest=sha256:e3638cffe8039e6e3096bed74ccf0581b23f2dba12f1d01d4322918ef4d026e3

Observation 9c7eab77-d681-4a8d-a209-6c61a6932a84 · outbound

This paper cites Audio-reasoner: Im- proving reasoning capability in large audio language models,.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Audio-reasoner: Im- proving reasoning capability in large audio language models,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T23:27:28.335871Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T23:27:27.785639Z digest=sha256:51dc7547c7ac036c325663da1c938d65dbbcc71fd3c13395f993ec53a631acd9

Observation 0e800d49-314d-4a38-8678-63d2554c9d14 · outbound

This paper cites EchoTraffic: Enhancing traffic anomaly understanding with audio-visual insights.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning EchoTraffic: Enhancing traffic anomaly understanding with audio-visual insights

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T23:27:28.320586Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T23:27:27.790312Z digest=sha256:85e5aa9683126601281875a3c8f7976d01bc7de61474c9cfc279b6c3f4564214

Observation 14e74d12-223f-40c8-99e1-52830f61462b · outbound

This paper cites Qwen2.5-Omni Technical Report.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Qwen2.5-Omni Technical Report

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.794790Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.794790Z digest=sha256:0b422651ea3c2eb8ae48fa727676e0da969126fac5127772a3f8e8ccd5fe3ea2

Observation 9fd210cb-f8a9-4e66-b6f0-a45c09f85238 · outbound

This paper cites Avqa: A dataset for audio- visual question answering on videos.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Avqa: A dataset for audio- visual question answering on videos

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T23:27:28.304745Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-15T23:27:27.799527Z digest=sha256:ed6fba6efcaa230891b04ebf6b436cc17c0d1039548d2d7e521e9a8e89081e0e

Observation a93e76ce-37e0-45b8-9e13-c96ca0fc2221 · outbound

This paper cites R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.803799Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.803799Z digest=sha256:6b592d62b73d573d685f6a99af5bb75659795f0bedcbc47d01dbe0931ac2a979

Observation 6bc1a75f-25e6-4a3b-b580-c93f4834e014 · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.808323Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.808323Z digest=sha256:a9f6a8697a5584820c3c4853913246e2f774ed7b939e4620c96dcd033e8c3c2d

Observation 1a53c6b4-b4dd-47ae-b0eb-acb21f4e9081 · outbound

This paper cites Scaling Relationship on Learning Mathematical Reasoning with Large Language Models.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Scaling Relationship on Learning Mathematical Reasoning with Large Language Models

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.813403Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.813403Z digest=sha256:af078764bd40e0ff476576ae89e39072c1dfc57d7058868328a225bc06fe59fb

Observation ef2f2f44-9146-4cf3-ba64-eafcc5f6c11e · outbound

This paper cites Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.818013Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.818013Z digest=sha256:91f4fea38163bb22296531f7efbfdd0e2bb4daeb66d6320fe138d06934bbfdec

Observation f7c1a011-9a13-42f2-a884-9b0061a923b5 · outbound

This paper cites R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.822566Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.822566Z digest=sha256:891dd12bad978b49a4f412f46a49473b4e2cd6d5277ef34ce309c370a3add563

Observation bd67daff-5bc9-4a8a-8bf3-cf5a2b685f90 · outbound

This paper cites R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.827281Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.827281Z digest=sha256:71218469cb06e6192129403fb23b05a5374d4525e25ab96bd92fbf13041cdf4f

Pith citing papers

Observation bb8cd184-7364-4401-a920-23f1239dae01 · inbound

Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models cites this paper.

Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T14:31:13.645079Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:31:13.645079Z digest=sha256:d7be2acf82463b99b40ab068ebbd10cac6f14dbfa73906f324b57b034b7b5429

Observation 8809531c-3f7a-4032-8af3-4ab46ef679fb · inbound

FinLMM-R1: Enhancing Financial Reasoning in LMM through Scalable Data and Reward Design cites this paper.

FinLMM-R1: Enhancing Financial Reasoning in LMM through Scalable Data and Reward Design EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:40.398754Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:40.398754Z digest=sha256:06aee23779f003dfe71a1707eb5435ecd577c0dff1798c72f5aea4ba6911c7be

Observation 2caf0f52-2c2f-4cb8-bcf5-c365bbbc7f9b · inbound

HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context cites this paper.

HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T22:36:15.038514Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:36:15.038514Z digest=sha256:c208b120cf8a27f77d09923cee70b23675ef668ff0cb68c865cb54fe17a23c15

Observation 2f29198a-1efa-4caf-8739-a82b313520b7 · inbound

The Landscape of Agentic Reinforcement Learning for LLMs: A Survey cites this paper.

The Landscape of Agentic Reinforcement Learning for LLMs: A Survey EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Reference 264

Resolution
verified exact
arxiv_id, observed 2026-05-18T19:21:48.404714Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-18T19:19:36.427337Z digest=sha256:b864ffe31d435a3faefe817a485cda399f811aaed883a03e9b6ff5ce1313cf82

Observation e0a7d057-b8c4-4e62-9dde-6caf0ffe500f · inbound

XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models cites this paper.

XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Reference 21

Resolution
verified exact
arxiv_id, observed 2026-05-18T05:45:56.120572Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-18T05:45:07.700571Z digest=sha256:90d7c0b95c4bd1a220706b801c1a8919dae90c79f4959567c22dc3ddf60c9a21

Observation 6cbf7b30-a75b-4436-97f2-cf6cb8b1392d · inbound

Development of a 3D-CNN-based Prediction Model for Migration Barriers in Plasma-Wall Interactions cites this paper.

Development of a 3D-CNN-based Prediction Model for Migration Barriers in Plasma-Wall Interactions EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Reference 4

Resolution
unresolved
no resolver link, observed 2026-07-13T09:25:05.174833Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T09:25:05.174833Z digest=sha256:283c35a7c124f0f23af40736a502097b085db7d46f43381c0f33a57df4755da8

Observation 0a9dfaff-cf0c-4434-995f-49833a1bc469 · inbound

Cross-Modal Coreference Alignment: Enabling Reliable Information Transfer in Omni-LLMs cites this paper.

Cross-Modal Coreference Alignment: Enabling Reliable Information Transfer in Omni-LLMs EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-05-10T23:25:49.792701Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-10T19:10:52.629490Z digest=sha256:75caf3312658197f3eec54656bfa5635a9404acef151648389acd30729b71ac3

Observation cb2b7095-f2cf-4861-8605-52d8989c1bad · inbound

Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding cites this paper.

Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Reference 28

Resolution
verified exact
arxiv_id, observed 2026-05-11T11:11:03.503815Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-10T15:07:45.595260Z digest=sha256:6f2bf2e070787ec1d0b74e45b074b1dccac9a369d4080fb0a554da3e37c22a03

Observation 87eebf59-fac5-45cc-b15c-4399c9236ab6 · inbound

Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale cites this paper.

Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Reference 21

Resolution
verified exact
arxiv_id, observed 2026-05-11T09:16:03.279034Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-10T16:07:52.017037Z digest=sha256:7e691acf6d40e15a9f48b02d14ba86c4c8a8d391829e460bf19a6788f7688e3d

Observation 1afb3801-19f9-4cf1-a99e-336a9f694b0a · inbound

Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs cites this paper.

Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Reference 28

Resolution
verified exact
arxiv_id, observed 2026-05-10T12:10:22.117814Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-10T12:05:54.551728Z digest=sha256:872737ba542ee05f7656e03cbb173f898b52eafc288b5eb3df5f6af48e71c0ad

Observation 43e2786f-801b-4e1b-aab3-a201e66cfbbc · inbound

AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers cites this paper.

AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Reference 32

Resolution
metadata mismatch
arxiv_id, observed 2026-05-10T09:18:32.200681Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-10T08:02:53.574120Z digest=sha256:de7c1ef4e0fa67a7beb4cbeb6a1a8f5b7f40e97a082afcac06d95926ff95a7b4

Observation dcd6a649-c1a0-4046-af9f-6f01963efd5f · inbound

LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning cites this paper.

LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-05-22T06:36:10.587746Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-22T06:34:57.483234Z digest=sha256:0992dca14bd76a492b90834485511164ed661ea1deec44b9d55f8eeb4c0ae5ce