{"as_of":"2026-08-14T14:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:62b33af72471692048216f2714443b6ea3bfa24d9175e9317ca80221f1a78501","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:31:13.645079Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T06:36:10.581673Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-08-07T14:31:13.645079Z","title":"Echoink-r1: Exploring audio-visual reasoning in multimodal llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-13T04:43:20.755335Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:13.645079Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:4300780f61c09107f9c4a25741c5d865fa67bfbb694aaed44b434394a204e661","observation_id":"bb8cd184-7364-4401-a920-23f1239dae01","resolution":{"observed_at":"2026-08-07T14:31:13.645079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-08-07T00:40:40.398754Z","title":"Hu, C.-W","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13066","last_updated":"2025-06-16T03:19:31Z","snapshot_observed_at":"2026-08-07T02:53:10.665842Z","submitted_at":"2025-06-16T03:19:31Z","title":"FinLMM-R1: Enhancing Financial Reasoning in LMM through Scalable Data and Reward Design","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:40.398754Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2506.13066"},"observation_digest":"sha256:e608d71767658eda9352173b3d77d76b7b043e21960779fa961cde38f362ba9d","observation_id":"8809531c-3f7a-4032-8af3-4ab46ef679fb","resolution":{"observed_at":"2026-08-07T00:40:40.398754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-08-06T22:36:15.038514Z","title":"Echoink-r1: Exploring audio-visual reasoning in multimodal llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.038514Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:8884ec8ff8fc7e9f91d427d2626a8e95831a4f39f002efd7c4dda860296176e8","observation_id":"2caf0f52-2c2f-4cb8-bcf5-c365bbbc7f9b","resolution":{"observed_at":"2026-08-06T22:36:15.038514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.04623","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Echoink-r1: Exploring audio-visual reasoning in multimodal llms via reinforcement learning","venue":null,"work_id":"1da0bbcc-d537-4e69-b29a-08f24dbbc696","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":264,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:514e82c9aeddbc58beac7ab8ef20ad63461eab9ad7db5f1511e76e28dc2793d1","observation_id":"2f29198a-1efa-4caf-8739-a82b313520b7","resolution":{"observed_at":"2026-05-18T19:21:48.404714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.04623","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Echoink-r1: Exploring audio-visual reasoning in multimodal llms via reinforcement learning","venue":null,"work_id":"1da0bbcc-d537-4e69-b29a-08f24dbbc696","year":2025},"citing_paper":{"arxiv_id":"2510.15148","last_updated":"2026-04-04T21:55:10Z","snapshot_observed_at":"2026-08-11T19:00:42.610450Z","submitted_at":"2025-10-16T21:10:22Z","title":"XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T05:45:07.700571Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2510.15148"},"observation_digest":"sha256:a2e325fb589ccee046057bdcf86ddf29ef5f913eef1b676fe589fa464d4d0012","observation_id":"e0a7d057-b8c4-4e62-9dde-6caf0ffe500f","resolution":{"observed_at":"2026-05-18T05:45:56.120572Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-07-13T09:25:05.174833Z","title":"Zhenghao Xing, Xiaowei Hu, Chi-Wing Fu, Wen- hai Wang, Jifeng Dai, and Pheng-Ann Heng","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.05521","last_updated":"2026-06-05T00:46:09Z","snapshot_observed_at":"2026-08-12T23:25:45.522343Z","submitted_at":"2026-04-07T07:18:58Z","title":"Development of a 3D-CNN-based Prediction Model for Migration Barriers in Plasma-Wall Interactions","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T09:25:05.174833Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2604.05521"},"observation_digest":"sha256:28bbbe95fd6236db73a2e01640c49ead02cdbac0da8a48c316407cdb412e1495","observation_id":"6cbf7b30-a75b-4436-97f2-cf6cb8b1392d","resolution":{"observed_at":"2026-07-13T09:25:05.174833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.04623","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Echoink-r1: Exploring audio-visual reasoning in multimodal llms via reinforcement learning","venue":null,"work_id":"1da0bbcc-d537-4e69-b29a-08f24dbbc696","year":2025},"citing_paper":{"arxiv_id":"2604.05522","last_updated":"2026-04-07T07:19:42Z","snapshot_observed_at":"2026-08-11T10:55:50.350550Z","submitted_at":"2026-04-07T07:19:42Z","title":"Cross-Modal Coreference Alignment: Enabling Reliable Information Transfer in Omni-LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T19:10:52.629490Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2604.05522"},"observation_digest":"sha256:37af367f2c526ef02c12fef840e08ec2c4ce90cdaba25a7582568c37cc0f08fd","observation_id":"0a9dfaff-cf0c-4434-995f-49833a1bc469","resolution":{"observed_at":"2026-05-10T23:25:49.792701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.04623","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Echoink-r1: Exploring audio-visual reasoning in multimodal llms via reinforcement learning","venue":null,"work_id":"1da0bbcc-d537-4e69-b29a-08f24dbbc696","year":2025},"citing_paper":{"arxiv_id":"2604.11244","last_updated":"2026-04-15T07:55:01Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T09:50:36Z","title":"Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T15:07:45.595260Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2604.11244"},"observation_digest":"sha256:6a63a045afb2edd8d2fe2439eb63cdb9e72e051c47b04175f73ba647c94f7127","observation_id":"cb2b7095-f2cf-4861-8605-52d8989c1bad","resolution":{"observed_at":"2026-05-11T11:11:03.503815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.04623","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Echoink-r1: Exploring audio-visual reasoning in multimodal llms via reinforcement learning","venue":null,"work_id":"1da0bbcc-d537-4e69-b29a-08f24dbbc696","year":2025},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:5a35dd6710c2b057a702612c943ebefef69517070c24411ba99d4ae8b79f46b5","observation_id":"87eebf59-fac5-45cc-b15c-4399c9236ab6","resolution":{"observed_at":"2026-05-11T09:16:03.279034Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.04623","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Echoink-r1: Exploring audio-visual reasoning in multimodal llms via reinforcement learning","venue":null,"work_id":"1da0bbcc-d537-4e69-b29a-08f24dbbc696","year":2025},"citing_paper":{"arxiv_id":"2604.14520","last_updated":"2026-04-16T01:21:14Z","snapshot_observed_at":"2026-08-14T06:53:31.710132Z","submitted_at":"2026-04-16T01:21:14Z","title":"Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T12:05:54.551728Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2604.14520"},"observation_digest":"sha256:4fbd59a807529afcf8a5c0fdac1a808a91dfb0c02856caa13cd28e95e9ecb2fd","observation_id":"1afb3801-19f9-4cf1-a99e-336a9f694b0a","resolution":{"observed_at":"2026-05-10T12:10:22.117814Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.04623","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Echoink-r1: Exploring audio-visual reasoning in multimodal llms via reinforcement learning","venue":null,"work_id":"1da0bbcc-d537-4e69-b29a-08f24dbbc696","year":2025},"citing_paper":{"arxiv_id":"2604.16617","last_updated":"2026-04-17T18:13:27Z","snapshot_observed_at":"2026-08-02T22:28:35.019925Z","submitted_at":"2026-04-17T18:13:27Z","title":"AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T08:02:53.574120Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2604.16617"},"observation_digest":"sha256:62469f38c848fb14af1430786908888e13b01b9878aac1e3f6ea2373e893a58c","observation_id":"43e2786f-801b-4e1b-aab3-a201e66cfbbc","resolution":{"observed_at":"2026-05-10T09:18:32.200681Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.04623","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Echoink-r1: Exploring audio-visual reasoning in multimodal llms via reinforcement learning","venue":null,"work_id":"1da0bbcc-d537-4e69-b29a-08f24dbbc696","year":2025},"citing_paper":{"arxiv_id":"2605.22012","last_updated":"2026-05-21T05:18:57Z","snapshot_observed_at":"2026-08-05T07:24:30.530987Z","submitted_at":"2026-05-21T05:18:57Z","title":"LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T06:34:57.483234Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2605.22012"},"observation_digest":"sha256:45a6d510da38cf193fe063e5441e06632e33965e0d69c5005d79b77dfd41ee4b","observation_id":"dcd6a649-c1a0-4046-af9f-6f01963efd5f","resolution":{"observed_at":"2026-05-22T06:36:10.587746Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.04623/citation-record","integrity":"/paper/2505.04623/integrity","json":"/paper/2505.04623/citation-record.json","paper":"/paper/2505.04623"},"outbound":[],"paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2505.04623."}