{"as_of":"2026-08-16T09:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:40d50da986b913211d1b91af49cf3e523f08bace288fe5c43c03bb424bcd448b","coverage":[{"denominator":100,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:03:20.975265Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02831/citation-record","integrity":"/paper/2608.02831/integrity","json":"/paper/2608.02831/citation-record.json","paper":"/paper/2608.02831"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:18.581426Z","title":"2023 , url =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:18.581426Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:cbb2210d55dbba47c83afe236751f9716f50429b66130c41cc1f128d3cc19d90","observation_id":"72216fe6-495e-419e-904f-05bda35caf94","resolution":{"observed_at":"2026-08-15T15:03:18.581426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:18.625181Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:18.625181Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:b04af26c4f15931bf35e1b849610e721ba6de507dc527a0c0d290d54fcbf6786","observation_id":"71ca77b9-c836-42c1-87dd-248d0c611006","resolution":{"observed_at":"2026-08-15T15:03:18.625181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-14T11:08:32.950294Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-15T15:03:18.649697Z","title":"arXiv preprint arXiv:2410.13720 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:18.649697Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:2c0eb24e52af4d98992392259dc98cce77317d67819a8f0736a27b01d544117a","observation_id":"792fb518-733e-4133-bf11-e4b9fb2ddb5d","resolution":{"observed_at":"2026-08-15T15:03:18.649697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.09272","last_updated":"2026-05-10T02:43:49Z","snapshot_observed_at":"2026-08-14T01:41:36.997424Z","submitted_at":"2026-05-10T02:43:49Z","title":"Towards Conversational Medical AI with Eyes, Ears and a Voice","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.09272","snapshot_observed_at":"2026-08-15T15:03:18.661572Z","title":"arXiv preprint arXiv:2605.09272 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:18.661572Z"},"links":{"cited_paper":"/paper/2605.09272","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:5434bbfea817aa7a2c6d58d1810f9b61cdf1500e646defffdaa158b349747255","observation_id":"6b351283-fb42-4f08-9ae0-69dce7cdb245","resolution":{"observed_at":"2026-08-15T15:03:18.661572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:18.666574Z","title":"Findings of the Association for Computational Linguistics: ACL 2025 , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:18.666574Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:2f4f194aa9f7d6bcc163e9f5463027e4abb34ad389e380c636e289e66a9438ae","observation_id":"b192ec25-585c-4b2a-98b4-41192c1b3902","resolution":{"observed_at":"2026-08-15T15:03:18.666574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:18.671105Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:18.671105Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:f323256b61c988a05f1971ce9be0dd21fadc4dbeed60edcb85bc0d1512212849","observation_id":"7381af69-928f-4fd3-8a28-94607cb518dd","resolution":{"observed_at":"2026-08-15T15:03:18.671105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12474","last_updated":"2026-05-12T17:54:25Z","snapshot_observed_at":"2026-08-11T10:04:43.760904Z","submitted_at":"2026-05-12T17:54:25Z","title":"Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12474","snapshot_observed_at":"2026-08-15T15:03:18.709576Z","title":"arXiv preprint arXiv:2605.12474 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:18.709576Z"},"links":{"cited_paper":"/paper/2605.12474","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:5c6b0b479cccec760012f187c8af50497043e04d27049b271c0a63617b3a8dec","observation_id":"bc2b904c-0fd8-4a08-8563-f4a70426a18c","resolution":{"observed_at":"2026-08-15T15:03:18.709576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:18.779868Z","title":"arXiv preprint arXiv:2602.05125 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:18.779868Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:813d68ce9688fac0267d37d1c2b4ea2aed43c19c01c4efabe46b2ba886cc0159","observation_id":"d8664f22-1f09-40cd-ac1d-461a833847cb","resolution":{"observed_at":"2026-08-15T15:03:18.779868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.20164","last_updated":"2026-05-19T17:50:18Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:50:18Z","title":"Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.20164","snapshot_observed_at":"2026-08-15T15:03:18.825053Z","title":"arXiv preprint arXiv:2605.20164 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:18.825053Z"},"links":{"cited_paper":"/paper/2605.20164","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:77ce8189aff1158b95cfc87d55dc2429de7b60011126c0d067bcb858b3bb3bce","observation_id":"916fd730-9271-4eb6-870c-6a209d65ee9c","resolution":{"observed_at":"2026-08-15T15:03:18.825053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T15:03:18.844112Z","title":"arXiv preprint arXiv:2501.12948 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:18.844112Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:a8419fef1ca6843207806b1b733e88bf6d00bb442bf70372343b9e0c2ff7218b","observation_id":"b8a86bb6-d29c-45c5-b3e6-ccfa8dd20dac","resolution":{"observed_at":"2026-08-15T15:03:18.844112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.26246","last_updated":"2026-07-28T20:31:48Z","snapshot_observed_at":"2026-08-12T12:03:15.179459Z","submitted_at":"2026-07-28T20:31:48Z","title":"Weak-to-Strong On-Policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.26246","snapshot_observed_at":"2026-08-15T15:03:18.871173Z","title":"arXiv preprint arXiv:2607.26246 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:18.871173Z"},"links":{"cited_paper":"/paper/2607.26246","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:93ced3dc83a510f0db22ed7af412a82b600b9cac7fa35c11d60086fde903d32d","observation_id":"53f5c82c-5342-4939-976b-994ae60b48b5","resolution":{"observed_at":"2026-08-15T15:03:18.871173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:18.876157Z","title":"arXiv preprint arXiv:2602.21628 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:18.876157Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:f23af89f5b589aa72710031b01d3133b4d7669a1fa4ea5cde40eaa80a85f1c0d","observation_id":"c5d69191-b1f5-4aa5-9a5b-2f7c6f16fc0e","resolution":{"observed_at":"2026-08-15T15:03:18.876157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.00846","last_updated":"2026-07-07T15:26:45Z","snapshot_observed_at":"2026-08-14T19:06:55.734090Z","submitted_at":"2026-01-31T18:20:45Z","title":"Omni-RRM: Advancing Omni Reward Modeling via Automatic Rubric-Grounded Preference Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.00846","snapshot_observed_at":"2026-08-15T15:03:18.880654Z","title":"arXiv preprint arXiv:2602.00846 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:18.880654Z"},"links":{"cited_paper":"/paper/2602.00846","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:6a15c529dbd0b50eb45a5a75facb003b2bb055d581ee89590494d6f2148752c2","observation_id":"6cf13027-e7d0-4867-ad6c-464d6450b724","resolution":{"observed_at":"2026-08-15T15:03:18.880654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.16600","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:23.725118Z","title":"arXiv preprint arXiv:2603.16600 , year=","venue":null,"work_id":"5e002244-9a22-429f-8a35-6fd0f531a85d","year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:18.885146Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:a3a63776e63483183d85cae8fe05a5e8fd80fbaf3415c0480dce19628bb6f0fa","observation_id":"0508a662-86ec-45ba-b422-fbde282f5187","resolution":{"observed_at":"2026-08-15T15:03:23.732358Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13029","last_updated":"2026-04-14T17:58:22Z","snapshot_observed_at":"2026-08-12T20:15:17.290437Z","submitted_at":"2026-04-14T17:58:22Z","title":"Visual Preference Optimization with Rubric Rewards","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13029","snapshot_observed_at":"2026-08-15T15:03:18.914108Z","title":"arXiv preprint arXiv:2604.13029 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:18.914108Z"},"links":{"cited_paper":"/paper/2604.13029","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:d04b08bb2c7f4b999462b9e706c5f61939d7fe04d5fdd88652863d3cd180a1ad","observation_id":"bf9335c5-335b-4e01-9de7-8a82f72280bc","resolution":{"observed_at":"2026-08-15T15:03:18.914108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14738","last_updated":"2026-04-18T22:41:52Z","snapshot_observed_at":"2026-07-06T22:32:51.756468Z","submitted_at":"2025-10-16T14:40:02Z","title":"AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14738","snapshot_observed_at":"2026-08-15T15:03:19.008040Z","title":"arXiv preprint arXiv:2510.14738 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.008040Z"},"links":{"cited_paper":"/paper/2510.14738","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:fa19ff22592c188a645c39c4a18b3bacdc805ac0e34fbc6964329795e1f1aecb","observation_id":"e3bb04da-0188-4c5e-81ba-9e91f6e90658","resolution":{"observed_at":"2026-08-15T15:03:19.008040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:19.084775Z","title":"arXiv preprint arXiv:2602.04649 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.084775Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:0a7cbbe7a8c969489237b35ef6194c44a45b341d46a7008f93aaa89b2df6c117","observation_id":"a5403e7e-d75e-4a25-ba2c-3ccadb4a6018","resolution":{"observed_at":"2026-08-15T15:03:19.084775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:19.110231Z","title":"arXiv preprint arXiv:2602.01511 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.110231Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:20744ad9078d65b9d2921229baefff1e80c882c3377cbbc04a090f3af5c1432b","observation_id":"a2bce307-639f-4de9-b3f6-da494af5e87b","resolution":{"observed_at":"2026-08-15T15:03:19.110231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:19.114984Z","title":"arXiv preprint arXiv:2510.07284 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.114984Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:2429d2f1e46ecfd0178100301c551d4f119b5aafe01826002ca2ad7ba589d365","observation_id":"02d019f0-b7a9-4c4b-87a5-92cb6fe569b8","resolution":{"observed_at":"2026-08-15T15:03:19.114984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:19.119412Z","title":"arXiv preprint arXiv:2602.10885 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.119412Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:bc20fa431f0bb41ed98e04403c960bc78acc5eda3c9f75c25b16a46e03247906","observation_id":"b46170ed-2603-4e1a-b81a-36d0e91c1504","resolution":{"observed_at":"2026-08-15T15:03:19.119412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19399","last_updated":"2026-05-15T01:32:52Z","snapshot_observed_at":"2026-08-14T13:19:21.831179Z","submitted_at":"2025-11-24T18:35:54Z","title":"DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.19399","snapshot_observed_at":"2026-08-15T15:03:19.123830Z","title":"arXiv preprint arXiv:2511.19399 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.123830Z"},"links":{"cited_paper":"/paper/2511.19399","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:6209f489379e5f88e39aa101ac35deea89cfb87b13083818a0654fa02ad8bcbd","observation_id":"9d8fc2a4-822b-4370-95d0-d656a24c9c3c","resolution":{"observed_at":"2026-08-15T15:03:19.123830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16949","last_updated":"2026-08-01T14:42:28Z","snapshot_observed_at":"2026-08-15T17:07:29.543548Z","submitted_at":"2025-08-23T08:47:31Z","title":"Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.16949","snapshot_observed_at":"2026-08-15T15:03:19.128691Z","title":"arXiv preprint arXiv:2508.16949 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.128691Z"},"links":{"cited_paper":"/paper/2508.16949","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:4df231c9b43de0e227e83661f3639cd845d8cf2efd295a5860f76c02cbec2ead","observation_id":"f8766714-db81-404c-bcc1-0bb3da494bfd","resolution":{"observed_at":"2026-08-15T15:03:19.128691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:19.134675Z","title":"arXiv e-prints , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.134675Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:14365e56e34880d0208e80166cb4a03a5f4392fe1efff5191e40a2c6d7cfee88","observation_id":"e08e7ca9-3d77-45e1-9500-41b955f68030","resolution":{"observed_at":"2026-08-15T15:03:19.134675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:19.209889Z","title":"Findings of the Association for Computational Linguistics: ACL 2025 , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.209889Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:cdf97894b7bd9631373f732d068c1a0f781538cfd58ff93708f6a166fa2ad806","observation_id":"a4458c19-3996-47b3-b819-7272e8cdea8f","resolution":{"observed_at":"2026-08-15T15:03:19.209889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:19.286838Z","title":"arXiv preprint arXiv:2510.07743 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.286838Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:a425bbae8c9bd0e2abb27bef84536ea50e4ed0a5b4856ae3c0224eebac737d34","observation_id":"755ce286-98ea-412e-8f11-4c2f041745b4","resolution":{"observed_at":"2026-08-15T15:03:19.286838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:19.312041Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.312041Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:a77d67194ca7aefabf2b9f5061ff16ceff0d36115d100fa95bf087b8fa3315b9","observation_id":"10f29666-f0fb-4867-9216-f43af663fb32","resolution":{"observed_at":"2026-08-15T15:03:19.312041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:19.338833Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.338833Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:ea5b5d77753b268e5de1e4a7934ad837d90c6bfca9e51dd43264bdb4d9623dab","observation_id":"84cf2d6b-28d9-4685-8548-b2c5901ac301","resolution":{"observed_at":"2026-08-15T15:03:19.338833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.20061","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:23.223931Z","title":"arXiv preprint arXiv:2512.20061 , year=","venue":null,"work_id":"bf574f43-0379-4d0f-8cf6-3009a8bed2d6","year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.351013Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:2e4dc974ba645da754e64b81adb38f735cc435364cbe0e4b53e9fd4bb5879ec2","observation_id":"e79e831e-a13f-4653-abf1-eabac051cf77","resolution":{"observed_at":"2026-08-15T15:03:23.289149Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:19.355489Z","title":"2025 , note =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.355489Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:c120aa82e4e61ee98998626b89946855752013b912d0bd8dc13f00aad276c8ba","observation_id":"805ab792-6c08-4804-baff-6260c54b2b9c","resolution":{"observed_at":"2026-08-15T15:03:19.355489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-15T15:03:19.360251Z","title":"arXiv preprint arXiv:2407.10759 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.360251Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:02d7a08afdff9854c2ed5b91f8cf20cb9fe5e3689c78d67147d1cb3898e084d0","observation_id":"91cf2320-3323-4c02-ab90-991d9d9f2bfd","resolution":{"observed_at":"2026-08-15T15:03:19.360251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:19.366027Z","title":"arXiv preprint arXiv:2512.23808 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.366027Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:b922f69cb6c0c2829661dc7b389cb283cf71c0ec4e27390dff3c5288c473f7c1","observation_id":"83f50cdd-9422-48ef-9bf1-25b52589f42d","resolution":{"observed_at":"2026-08-15T15:03:19.366027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:19.370901Z","title":"GitHub Repository , howpublished =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.370901Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:fa701e494266dab8fe40c0b07041c468056e7f232923e1d20e714ad979a5a9ab","observation_id":"1368ded1-c337-493f-bfda-201846e9122c","resolution":{"observed_at":"2026-08-15T15:03:19.370901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:19.451588Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.451588Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:235f15b5a464bd0dbf3a90fad2025e9769a54a36269e72a77a22d6ff1ab1deef","observation_id":"96e52be7-700f-40ed-b7bf-8da55657667b","resolution":{"observed_at":"2026-08-15T15:03:19.451588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-14T03:45:52.225630Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-15T15:03:19.523791Z","title":"arXiv preprint arXiv:2412.08905 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.523791Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:84cdbc4cc12502a3e62c8a117275c6a328f9b5034739e7dfdbc5d5b4fa2371be","observation_id":"f57fddee-fb5b-4140-9948-206b046ed244","resolution":{"observed_at":"2026-08-15T15:03:19.523791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-08-13T23:38:52.637908Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16632","snapshot_observed_at":"2026-08-15T15:03:19.543459Z","title":"arXiv preprint arXiv:2507.16632 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.543459Z"},"links":{"cited_paper":"/paper/2507.16632","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:681f68362306fb88eb3d883f00213e26be660c68697ef24ec3b26d9759a7d307","observation_id":"dbc53e42-853c-4d2b-9912-440442962e9f","resolution":{"observed_at":"2026-08-15T15:03:19.543459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:19.556237Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.556237Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:3e6d517bafaff9cba3025ddc695a0cddda689bbc683de34bd779234d82628e30","observation_id":"fcd7c6fe-712e-492e-bfe7-f094a964f728","resolution":{"observed_at":"2026-08-15T15:03:19.556237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-15T15:03:19.561459Z","title":"arXiv preprint arXiv:2504.18425 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.561459Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:cd89ef59b7e2fe4f1345407eb5d95de2be99e073d586e4d8cbfebb033561f351","observation_id":"3fb62d8f-43a0-49c1-939d-9d3c9cd7c99d","resolution":{"observed_at":"2026-08-15T15:03:19.561459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-15T15:03:19.566176Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.566176Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:b47fbd9cb16cf0c9654e028a5a7b00a500115df022008177f91b17a042830259","observation_id":"892b46d4-76e5-4e00-8810-a2539cbca3f9","resolution":{"observed_at":"2026-08-15T15:03:19.566176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:19.571016Z","title":"2023 , url =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.571016Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:ad489cdae20c2fc431cd906b32c5b974b3ef0751efcb038d2f62b1f2bab79e87","observation_id":"062b5297-4454-4015-8984-b51b5b9e74ac","resolution":{"observed_at":"2026-08-15T15:03:19.571016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-07T17:26:13.091608Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-15T15:03:19.576273Z","title":"Sakshi and Jaehyeon Kim and Wei Ping and Rafael Valle and Dinesh Manocha and Bryan Catanzaro , title =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.576273Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:ab1099395052c6570eb5503b4ae0bb86aaf9125604a494665ae23d93e75c62f5","observation_id":"ed269b75-4fc8-4ee2-8213-14e5013f8b44","resolution":{"observed_at":"2026-08-15T15:03:19.576273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08128","last_updated":"2025-07-28T22:53:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-10T19:40:21Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.08128","snapshot_observed_at":"2026-08-15T15:03:19.649811Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models , journal =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.649811Z"},"links":{"cited_paper":"/paper/2507.08128","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:3b8a03e586e933977f3005b177b901ff7dd09a7d1425effbc3c4aa86abc91a1b","observation_id":"408d63c8-a2f3-40f7-984f-14471f6baf20","resolution":{"observed_at":"2026-08-15T15:03:19.649811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:19.700472Z","title":"Proceedings of the 30th ACM International Conference on Multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.700472Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:b48da2d930b0e2bea64bac3a2e6926ae6911f35bebdbb1525f3fcf31df32d1ae","observation_id":"bf21f3db-143e-4426-9af6-e154cca7e7f6","resolution":{"observed_at":"2026-08-15T15:03:19.700472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-15T15:03:19.705103Z","title":"Goucher and Adam Perelman and Aditya Ramesh and Aidan Clark and AJ Ostrow and Akila Welihinda and Alan Hayes and Alec Radford and Aleksander Madry and Alex Baker","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.705103Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:e6a3a7daa292c486141f9ccdb53caf679bf5f58689f744a89e05c09ae29f82ba","observation_id":"4979d106-6962-4cce-a85d-f05c22290330","resolution":{"observed_at":"2026-08-15T15:03:19.705103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T15:03:19.710688Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.710688Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:c9975250f76ec4ac75b985993d3da24305c13d0fa76208ae7f47f67f832158ee","observation_id":"bce34aef-7560-453d-b0c9-683dc715a272","resolution":{"observed_at":"2026-08-15T15:03:19.710688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:19.758595Z","title":"Wav2CLIP: Learning Robust Audio Representations from Clip , booktitle =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.758595Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:a96c674324ec2938c79ab5a6379d53f78e8c8443cb2ceecd66eed57325f83589","observation_id":"30e0b09b-1c71-4b5b-a9c7-a616aa2077bc","resolution":{"observed_at":"2026-08-15T15:03:19.758595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:19.852290Z","title":"Pengi: An Audio Language Model for Audio Tasks , booktitle =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.852290Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:bb63c2be0ade6fe900d6cadcd4e49d51a826bd04510485873e5d889425ecd852","observation_id":"b1a30ca8-d537-4c9c-8ff5-81f697b2f874","resolution":{"observed_at":"2026-08-15T15:03:19.852290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:19.892520Z","title":"Liu and Leonid Karlinsky and James R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.892520Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:93f58b6c629329c4cf0797ffd96c846fce1f01c059e54ed6b7c71318cd007164","observation_id":"9828d1af-c9e9-40fd-8c0c-e72a46e73ad2","resolution":{"observed_at":"2026-08-15T15:03:19.892520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:19.919121Z","title":"Optimal Transport for Treatment Effect Estimation , booktitle =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.919121Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:282df5a4fb28f64d13cc50645d9c037d358fe4fdccdf827afa3bf3cbe775661d","observation_id":"b78d0eb0-5e1a-4b70-b1e3-1801971d62a0","resolution":{"observed_at":"2026-08-15T15:03:19.919121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04145","last_updated":"2023-02-27T02:09:25Z","snapshot_observed_at":"2026-08-13T17:19:38.594742Z","submitted_at":"2021-12-08T06:52:23Z","title":"A Review for Deep Reinforcement Learning in Atari:Benchmarks, Challenges, and Solutions","version":5},"cited_work":{"arxiv_id":"2112.04145","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.04145","snapshot_observed_at":"2026-08-15T15:03:22.975213Z","title":"A Review for Deep Reinforcement Learning in Atari:Benchmarks, Challenges, and Solutions","venue":"cs.AI","work_id":"de569396-b695-4722-b043-d36eb0550540","year":2021},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.935357Z"},"links":{"cited_paper":"/paper/2112.04145","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:b882c034f5e95fc8d8c0df2841a1198fe846afa6f014610510aca1ef7e3872c2","observation_id":"728c110c-c656-4ac6-aead-94f440a4a37c","resolution":{"observed_at":"2026-08-15T15:03:22.979713Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:19.948878Z","title":"Learnable Behavior Control: Breaking Atari Human World Records via Sample-Efficient Behavior Selection , booktitle =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.948878Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:c0c5aef217335ebb8d050c608572c1edb87ef50ff6bf09e7b8a955fa3e5bca6a","observation_id":"e9e73edb-7dfe-40b3-ba74-c91d9523a45f","resolution":{"observed_at":"2026-08-15T15:03:19.948878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:19.953538Z","title":"Generalized Data Distribution Iteration , booktitle =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.953538Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:f40d7b34e7b05730d4c8bba7ea599c19e70ce2642e3cf3c9b196716fed49dc8e","observation_id":"b07f9220-dfda-4365-92c6-e414a912928a","resolution":{"observed_at":"2026-08-15T15:03:19.953538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06232","last_updated":"2022-01-09T12:26:35Z","snapshot_observed_at":"2026-08-13T19:05:21.331290Z","submitted_at":"2021-06-11T08:31:12Z","title":"GDI: Rethinking What Makes Reinforcement Learning Different From Supervised Learning","version":6},"cited_work":{"arxiv_id":"2106.06232","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06232","snapshot_observed_at":"2026-08-15T15:03:22.954986Z","title":"GDI: Rethinking What Makes Reinforcement Learning Different From Supervised Learning","venue":"cs.LG","work_id":"1af697bf-f013-40cd-9c39-a1c963744ec1","year":2021},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.958819Z"},"links":{"cited_paper":"/paper/2106.06232","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:6e89c484c3bd28ba99aaa988933577e9a93d66c9e31e14731810f999215d4d34","observation_id":"1f805ee3-1663-457a-90ad-8389f43503e5","resolution":{"observed_at":"2026-08-15T15:03:22.960912Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2506.12723","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:21.693351Z","title":"CoRR , volume =","venue":null,"work_id":"a1db14f3-a993-4c10-9fb6-7a84eb75b5df","year":2025},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.963566Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:0453f1e4aade28f1ee248a858a7a1d6c17284e578a4cb232c5ea764143558828","observation_id":"ffaa1268-31b3-4a35-a753-2b83caf1f6b4","resolution":{"observed_at":"2026-08-15T15:03:21.712228Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02925","last_updated":"2023-10-08T08:56:56Z","snapshot_observed_at":"2026-08-13T10:40:08.783928Z","submitted_at":"2023-08-05T17:33:17Z","title":"ConvFormer: Revisiting Transformer for Sequential User Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02925","snapshot_observed_at":"2026-08-15T15:03:19.968134Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.968134Z"},"links":{"cited_paper":"/paper/2308.02925","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:8bc51ee0ba84a41ffd120fddb2899c0881c41b6fa826d41a7790528954ffb8c6","observation_id":"138fa139-ddc6-468a-8ed4-59caedd7aac4","resolution":{"observed_at":"2026-08-15T15:03:19.968134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.00707","last_updated":"2021-06-01T18:04:19Z","snapshot_observed_at":"2026-08-13T19:12:19.983919Z","submitted_at":"2021-06-01T18:04:19Z","title":"An Entropy Regularization Free Mechanism for Policy-based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2106.00707","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.00707","snapshot_observed_at":"2026-08-15T15:03:22.794969Z","title":"An Entropy Regularization Free Mechanism for Policy-based Reinforcement Learning","venue":"cs.LG","work_id":"3bed49e4-14a8-47dc-88f5-a2cd976fc14d","year":2021},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:19.988866Z"},"links":{"cited_paper":"/paper/2106.00707","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:efa68b2876aaa5a26c863963f4cd3a66cbbec49ffce75d2443ae0142782e2f13","observation_id":"d41bf1c5-dac8-4837-b86d-d1fa01317ec9","resolution":{"observed_at":"2026-08-15T15:03:22.865970Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:20.058803Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.058803Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:6fc1972fce2b8eca62cf4990aa7c98942f1397aa3a885e1ad9ea105757e09074","observation_id":"11f073e4-12f2-4547-8378-34affe85b0c5","resolution":{"observed_at":"2026-08-15T15:03:20.058803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.06752","last_updated":"2020-11-13T04:14:40Z","snapshot_observed_at":"2026-08-13T21:03:38.602966Z","submitted_at":"2020-11-13T04:14:40Z","title":"Critic PI2: Master Continuous Planning via Policy Improvement with Path Integrals and Deep Actor-Critic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2011.06752","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.06752","snapshot_observed_at":"2026-08-15T15:03:22.723446Z","title":"Critic PI2: Master Continuous Planning via Policy Improvement with Path Integrals and Deep Actor-Critic Reinforcement Learning","venue":"cs.LG","work_id":"20c7f241-c46b-4377-bcb2-18a5d2d056d2","year":2020},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.105498Z"},"links":{"cited_paper":"/paper/2011.06752","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:dc771fcbdc8ddccf7f3fd75d8bcf70ec57c78c50d47fc64a5e0ca20fb70ab1b5","observation_id":"9ed0d688-2461-4f30-b7b5-801b438fa434","resolution":{"observed_at":"2026-08-15T15:03:22.728094Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:20.115850Z","title":"The Thirteenth International Conference on Learning Representations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.115850Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:6a0c9feb5b5d19a1922236959f390bb9a0a93855b2403718bf49b4eda9b95207","observation_id":"42050181-ba8e-4490-8b73-1e98df06e938","resolution":{"observed_at":"2026-08-15T15:03:20.115850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2506.07459","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:21.490901Z","title":"CoRR , volume =","venue":null,"work_id":"d0d433da-c408-4649-959a-d2898629219b","year":2025},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.135289Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:f9ff2de1eb5b29c22d722816bc28f1ae012e8f06691239472243183902e424f3","observation_id":"387a6d8f-8aa8-45f4-92a0-01c432cbf2c6","resolution":{"observed_at":"2026-08-15T15:03:21.519822Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2506.07413","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:21.296660Z","title":"CoRR , volume =","venue":null,"work_id":"228e570c-32de-4316-9f0c-9c43f7ba85f6","year":2025},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.141645Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:07dce4a2ac12e5a4b8f1c66bf699b137dc08053f4940aea3e4aaeaf4abce50af","observation_id":"a87e8a5b-1927-4c1b-b1d2-a852b17fb217","resolution":{"observed_at":"2026-08-15T15:03:21.373181Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T15:03:20.146090Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.146090Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:f9f61fb079b4f30e32b98db295c1c0908dd1a162c12860022a4bebc2c7136c13","observation_id":"756766ed-ab52-499c-a4eb-9979d6b2fe6b","resolution":{"observed_at":"2026-08-15T15:03:20.146090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.03923","last_updated":"2023-02-25T12:36:54Z","snapshot_observed_at":"2026-08-13T19:25:53.525013Z","submitted_at":"2021-05-09T12:45:13Z","title":"CASA: Bridging the Gap between Policy Improvement and Policy Evaluation with Conflict Averse Policy Iteration","version":5},"cited_work":{"arxiv_id":"2105.03923","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.03923","snapshot_observed_at":"2026-08-15T15:03:22.483063Z","title":"CASA: Bridging the Gap between Policy Improvement and Policy Evaluation with Conflict Averse Policy Iteration","venue":"cs.LG","work_id":"bc63cf9a-2d25-4989-a390-8dd625e9ce94","year":2021},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.150236Z"},"links":{"cited_paper":"/paper/2105.03923","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:8c8f8f141a58379e4f013a0e0ec1bb631402d70bde58e3303e3773cfc1b5e743","observation_id":"f0ea545a-123f-4ed7-b3a7-c1aa43dac51f","resolution":{"observed_at":"2026-08-15T15:03:22.574300Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05010","last_updated":"2024-07-06T09:04:27Z","snapshot_observed_at":"2026-08-12T23:27:43.101877Z","submitted_at":"2024-07-06T09:04:27Z","title":"PRANCE: Joint Token-Optimization and Structural Channel-Pruning for Adaptive ViT Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05010","snapshot_observed_at":"2026-08-15T15:03:20.155097Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.155097Z"},"links":{"cited_paper":"/paper/2407.05010","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:1da671d88dab245bd8245637cf2357f0df5c4012cd9f10beb91357e047e2aaa3","observation_id":"b92d5a4c-34ec-4aa9-bae0-66dd32b5265f","resolution":{"observed_at":"2026-08-15T15:03:20.155097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:20.161486Z","title":"The Twelfth International Conference on Learning Representations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.161486Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:7f27c4d75260489ce5857187d527e5a6f3cd68fd10087fb3247d84c03820a06a","observation_id":"ed3c6e28-6c7b-4d0a-bdf1-61f853351175","resolution":{"observed_at":"2026-08-15T15:03:20.161486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:20.165992Z","title":"Forty-first International Conference on Machine Learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.165992Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:e7ffec75b1fab5746a91ba1740c1422655fb65c9cc91cca6a3088728c10d5546","observation_id":"c7951792-715b-4bd3-9bab-db3d33bbc5fa","resolution":{"observed_at":"2026-08-15T15:03:20.165992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-15T15:03:20.170110Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.170110Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:9d0e9710218aecf9d08a85eef44d2d1fe994f1e4779b1433d991d204cbf408d5","observation_id":"481d5bb3-0fc2-4202-8a8e-79832571323d","resolution":{"observed_at":"2026-08-15T15:03:20.170110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-15T15:03:20.198940Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.198940Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:1527e70cd32899c5c869b3ff71ee0f2d56a2a822586e6c13e1436574c621492c","observation_id":"1f4173fc-edb0-4d53-8eac-efb12e9a8f99","resolution":{"observed_at":"2026-08-15T15:03:20.198940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-15T15:03:20.279703Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.279703Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:0ea2301255e91be1950f61c0308f0ff7e5b825268843488e03d6b6aa36a984fa","observation_id":"660e61f1-abc9-44cc-b825-aab9f7c42f1d","resolution":{"observed_at":"2026-08-15T15:03:20.279703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:20.351600Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.351600Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:85e7d33f953f598ea66a2e09ba8425f54cdecbf5a1cc5c55f9c654a15a1137d9","observation_id":"a3d8f8ca-0a76-46f2-984a-064371b741c4","resolution":{"observed_at":"2026-08-15T15:03:20.351600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:20.360298Z","title":"Chi and Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.360298Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:00c75687ec9b6acafdad7000748c544ea1390ab17be6b85ddc06830f5a0b906a","observation_id":"b0489be7-acc5-4149-8819-c40f686a191b","resolution":{"observed_at":"2026-08-15T15:03:20.360298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05355","last_updated":"2024-07-07T13:10:23Z","snapshot_observed_at":"2026-08-12T23:27:22.218937Z","submitted_at":"2024-07-07T13:10:23Z","title":"VideoCoT: A Video Chain-of-Thought Dataset with Active Annotation Tool","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05355","snapshot_observed_at":"2026-08-15T15:03:20.377256Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.377256Z"},"links":{"cited_paper":"/paper/2407.05355","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:54743cde492b71571185052cfed3af15755586c0acc1e518491e1a772f3dec8f","observation_id":"9af4c5fc-1cac-44ca-b38d-c5c61af4733f","resolution":{"observed_at":"2026-08-15T15:03:20.377256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07246","last_updated":"2025-01-13T11:54:40Z","snapshot_observed_at":"2026-08-10T20:44:17.043889Z","submitted_at":"2025-01-13T11:54:40Z","title":"Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07246","snapshot_observed_at":"2026-08-15T15:03:20.385682Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.385682Z"},"links":{"cited_paper":"/paper/2501.07246","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:56d1b32e298ead0397f20ec747177a517c44da062e91bd0da6f1d45aacbbdce5","observation_id":"e69da737-0048-43c4-87f9-0e5d530e99fa","resolution":{"observed_at":"2026-08-15T15:03:20.385682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:20.395521Z","title":"arXiv preprint arXiv:2505.09439 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.395521Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:1cf23749b5ced3f51d9c22bdc56ce3d08660cccac7f84a735a5f9f2fabdd3e86","observation_id":"ed36e967-d8b3-4e60-9359-74763bee8d0a","resolution":{"observed_at":"2026-08-15T15:03:20.395521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:24.084944Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":"4ccdfff6-2c2d-464b-8b94-8d1be3a4bced","year":2025},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.400512Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:1b396235f9f77e4455d81631a43a0d42dad0afe41c292ca4f010ab93b49b777e","observation_id":"1c989b9f-481e-4eaf-8111-9fc5d7675a07","resolution":{"observed_at":"2026-08-15T15:03:24.089602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2503.02318","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:21.136828Z","title":"CoRR , volume =","venue":null,"work_id":"574e9733-8e84-4064-a7bb-b41401d17cf4","year":2025},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.455039Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:d9f9892397550443056c55fc37bd5025df500e916642e529a54759788c2e4acb","observation_id":"877eeec4-b2c2-4518-af80-6161986805d6","resolution":{"observed_at":"2026-08-15T15:03:21.160237Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-15T15:03:20.510220Z","title":"OpenAI o1 System Card , journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.510220Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:18b55c3a2fd4b82149729b6c3d69324ccce2b4bb1b7118e6a9d83b9de67ae038","observation_id":"ce525799-8429-4255-a847-31f28ecd5dc1","resolution":{"observed_at":"2026-08-15T15:03:20.510220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:20.555188Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.555188Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:e8af1486e5e49b375bd79ce3a677372eab7cc37f54a1f7af2cbba74146f6b0bd","observation_id":"94cde8fa-d300-442e-a0de-67bbba8cd3f2","resolution":{"observed_at":"2026-08-15T15:03:20.555188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05673","last_updated":"2025-05-27T03:51:13Z","snapshot_observed_at":"2026-08-12T23:47:07.771336Z","submitted_at":"2024-06-09T07:06:58Z","title":"Flow of Reasoning: Training LLMs for Divergent Reasoning with Minimal Examples","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05673","snapshot_observed_at":"2026-08-15T15:03:20.562839Z","title":"arXiv preprint arXiv:2406.05673 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.562839Z"},"links":{"cited_paper":"/paper/2406.05673","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:7dd684eaf5fac5530ece916b381410602e5b97ee88b5cf71721c6e36575922f4","observation_id":"b083773d-80a2-43c4-86ea-b54cf54fa156","resolution":{"observed_at":"2026-08-15T15:03:20.562839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06559","last_updated":"2026-04-16T17:52:47Z","snapshot_observed_at":"2026-07-06T22:41:19.981014Z","submitted_at":"2026-01-10T13:05:23Z","title":"ArrowGEV: Grounding Events in Video via Learning the Arrow of Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.06559","snapshot_observed_at":"2026-08-15T15:03:20.568224Z","title":"arXiv preprint arXiv:2601.06559 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.568224Z"},"links":{"cited_paper":"/paper/2601.06559","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:9d3fc8a5378fd8fdf89f74955d4f27126e16b826132cb6df901b6780aca322d9","observation_id":"389babb4-8067-4623-94f0-e6a98e2176cc","resolution":{"observed_at":"2026-08-15T15:03:20.568224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:20.573032Z","title":"arXiv preprint arXiv:2601.04171 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.573032Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:0ebd7c4be50e8e89dddff4077a31a29b3f7a0e337a5ed210691f3df7786aa226","observation_id":"65d8f06a-9ef3-4083-85a6-64e54213076d","resolution":{"observed_at":"2026-08-15T15:03:20.573032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:20.577377Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.577377Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:e61dca1245ebc324479e6eb111661ba76db28cf388746a3bf2525ccd2ca3814f","observation_id":"0026c232-25bd-40df-9311-566675c39b47","resolution":{"observed_at":"2026-08-15T15:03:20.577377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:20.581542Z","title":"arXiv preprint arXiv:2511.12344 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.581542Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:8653b8e181bd9145ee34e0f8916f4d57cf2f8a35c51a9b860bdc0d5d2c74044a","observation_id":"652fe124-886a-49a2-a202-f4243add5ad9","resolution":{"observed_at":"2026-08-15T15:03:20.581542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-08-12T14:23:22.826603Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17746","snapshot_observed_at":"2026-08-15T15:03:20.621494Z","title":"arXiv preprint arXiv:2507.17746 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.621494Z"},"links":{"cited_paper":"/paper/2507.17746","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:5d70f84c8bcc536dcd9ec784e9164ad252f129ad86de0db1dccdf6186f1fe34e","observation_id":"602e71bc-99a6-4250-b101-c9e970599ba2","resolution":{"observed_at":"2026-08-15T15:03:20.621494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T15:03:20.696940Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning , journal =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.696940Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:933223f8035a7b687c665c0f756535da1645ce800f4b2d9c0fad763f460dd75a","observation_id":"a17686b4-faa4-4dbe-a94b-175b59ec8dd1","resolution":{"observed_at":"2026-08-15T15:03:20.696940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T15:03:20.707594Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.707594Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:0e252b3eb2e255a7a74f091d35467f204a2816af78daace6417dba34387cac3b","observation_id":"0fd3169b-a755-4720-9a19-c79a79d28949","resolution":{"observed_at":"2026-08-15T15:03:20.707594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11197","last_updated":"2025-05-14T02:12:43Z","snapshot_observed_at":"2026-08-10T15:19:55.764802Z","submitted_at":"2025-03-14T08:43:53Z","title":"Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11197","snapshot_observed_at":"2026-08-15T15:03:20.714065Z","title":"arXiv preprint arXiv:2503.11197 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.714065Z"},"links":{"cited_paper":"/paper/2503.11197","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:4447130e7494dba1c2caa362695cd8234e157945f097fa611f8b9f275a946af8","observation_id":"1827b252-7810-415f-8faa-4cc420b239e4","resolution":{"observed_at":"2026-08-15T15:03:20.714065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19168","last_updated":"2024-10-24T21:20:10Z","snapshot_observed_at":"2026-08-13T20:48:30.133767Z","submitted_at":"2024-10-24T21:20:10Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19168","snapshot_observed_at":"2026-08-15T15:03:20.718955Z","title":"arXiv preprint arXiv:2410.19168 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.718955Z"},"links":{"cited_paper":"/paper/2410.19168","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:a703b234b61aea1a67174f126ddda2897ec833d92d52d19bf5857781085faefd","observation_id":"df1668f8-2120-411b-aaae-29d81836699a","resolution":{"observed_at":"2026-08-15T15:03:20.718955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:24.054023Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":"25209a60-aef4-4426-91e2-ff30d65aaec8","year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.723150Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:d7f53e74666e4dc98012e495036da77c669f46b04ceed154ec948386571db87a","observation_id":"b9eb6e47-3bb7-486b-8094-dbbdd94d5ef3","resolution":{"observed_at":"2026-08-15T15:03:24.058821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12527","last_updated":"2026-07-03T08:49:19Z","snapshot_observed_at":"2026-07-12T21:18:44.451500Z","submitted_at":"2026-04-14T10:00:39Z","title":"Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.12527","snapshot_observed_at":"2026-08-15T15:03:20.727700Z","title":"arXiv preprint arXiv:2604.12527 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.727700Z"},"links":{"cited_paper":"/paper/2604.12527","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:1a1c1f3bfee081c9dbbe1d7e24ecc36f5bdbf59fd41233a8996b1b0979435d41","observation_id":"748f3498-457e-4e52-b56b-997bedb389a7","resolution":{"observed_at":"2026-08-15T15:03:20.727700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:20.732762Z","title":"arXiv preprint arXiv:2510.11454 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.732762Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:d6f52efdfa22c9f40af5bc3978d72c7b11e776aa9186441249c42aa6ff4477ed","observation_id":"4c0b6bb3-54e3-4b8e-91e8-fdde00dd4f61","resolution":{"observed_at":"2026-08-15T15:03:20.732762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:20.738254Z","title":"arXiv preprint arXiv:2602.13685 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.738254Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:3aef31a0a18337604f600a461c2dc7e393d6a2eaf25dd40a4fdb1621bd71282f","observation_id":"237af61d-854e-4b40-8c41-d0306751dc8b","resolution":{"observed_at":"2026-08-15T15:03:20.738254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:20.755835Z","title":"arXiv preprint arXiv:2602.10439 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.755835Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:1d63ecb72073ee969519c484554f3bd3b366005d537f002fb2eef86c8d74ef67","observation_id":"b1ed2f30-6bc0-41c1-8dea-40b86a3f9ffb","resolution":{"observed_at":"2026-08-15T15:03:20.755835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:20.836254Z","title":"arXiv preprint arXiv:2511.15848 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.836254Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:82bac05277c68316fd6fe98dec4b8dfbbfe3bc03b36eb41fa5b19441b0f0e2e6","observation_id":"e01833b1-7489-43d6-860f-65c49c36f36e","resolution":{"observed_at":"2026-08-15T15:03:20.836254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:20.940583Z","title":"arXiv preprint arXiv:2510.20867 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.940583Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:408d17cf8079f2db68181374f0853d091486df5490a141b596530f89c0acd60c","observation_id":"eb4a273d-1e96-4cd6-a3b7-815e029e6bac","resolution":{"observed_at":"2026-08-15T15:03:20.940583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:20.950109Z","title":"ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.950109Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:4c082d25d301229b0e5995879070ec16de2476958280a00149b9673407cf704f","observation_id":"5abab500-ae57-464d-a697-239e877fa343","resolution":{"observed_at":"2026-08-15T15:03:20.950109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:20.956623Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.956623Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:e46fb59c94153f97dbd6c7fdbd15dfe1092439e16cc522d41623f39d8098979c","observation_id":"dd5cdea5-df55-44ed-b1d4-650180864af5","resolution":{"observed_at":"2026-08-15T15:03:20.956623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:20.960816Z","title":"ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.960816Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:1cf1e46c1b1badff679c481670913b107bf12208f52b68f5eaaf666f40a7aecc","observation_id":"8c6403d2-eafe-41d5-b5b6-83de8429d7cb","resolution":{"observed_at":"2026-08-15T15:03:20.960816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:03:20.965844Z","title":"arXiv preprint arXiv:2503.02318 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.965844Z"},"links":{"citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:fceaf3062fb0126abf0eea5fe5c155225c2f3138d478148a7aa2a509ae4141fa","observation_id":"da89599d-4536-4118-9ac9-de4e36b77b62","resolution":{"observed_at":"2026-08-15T15:03:20.965844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04779","last_updated":"2026-03-16T09:24:19Z","snapshot_observed_at":"2026-08-15T11:17:04.997179Z","submitted_at":"2025-06-05T09:09:36Z","title":"MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04779","snapshot_observed_at":"2026-08-15T15:03:20.969779Z","title":"arXiv preprint arXiv:2506.04779 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.969779Z"},"links":{"cited_paper":"/paper/2506.04779","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:6809a1d0dd38ff2f16ae7703807285127301ebb71d329ce426adb6b2bd2181da","observation_id":"19c6c492-c904-440e-8f5e-f348a5ff0837","resolution":{"observed_at":"2026-08-15T15:03:20.969779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13032","last_updated":"2025-05-19T12:18:42Z","snapshot_observed_at":"2026-08-15T20:19:07.938731Z","submitted_at":"2025-05-19T12:18:42Z","title":"MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13032","snapshot_observed_at":"2026-08-15T15:03:20.975265Z","title":"arXiv preprint arXiv:2505.13032 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-15T15:03:20.975265Z"},"links":{"cited_paper":"/paper/2505.13032","citing_paper":"/paper/2608.02831"},"observation_digest":"sha256:486d3d56aae4e0761c6919ac4020be990404bafce01b216b6c99da236df9be80","observation_id":"b80465ce-e474-44f0-a20b-6006416d3654","resolution":{"observed_at":"2026-08-15T15:03:20.975265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.02831","last_updated":"2026-08-03T19:46:13Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-15T16:48:52.131057Z","submitted_at":"2026-08-03T19:46:13Z","title":"Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":87,"verified_exact":11,"verified_fuzzy":2},"total_outbound_references":100},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 100 of 100 outbound references and 0 inbound Pith citation observations for arXiv:2608.02831."}