{"as_of":"2026-08-17T22:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:141a9522f9d94781649f03245d425a1e1ae1a28505ea4accafb5d68b2c97138a","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T15:40:22.428261Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.13239/citation-record","integrity":"/paper/2608.13239/integrity","json":"/paper/2608.13239/citation-record.json","paper":"/paper/2608.13239"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:40:23.504209Z","title":"In: Proceedings of the 33rd ACM International Confer- ence on Multimedia","venue":null,"work_id":"35d75552-dc43-4608-9ba3-b2743d39d844","year":2025},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.183478Z"},"links":{"citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:5f63bae69c5e9ef357cce8e32d615fe30f9aa5e345094bb787de1a87ac6e901e","observation_id":"fcb3e689-f5cc-4edf-b386-61120ec4cc92","resolution":{"observed_at":"2026-08-14T15:40:23.511709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:40:23.485888Z","title":"In: Belgrave, D., Zhang, C., Lin, H., Pascanu, R., Koniusz, P., Ghassemi, M., Chen, N","venue":null,"work_id":"9fd1023f-a49f-4d8f-b9a3-e4e3bd1d97ac","year":2025},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.189912Z"},"links":{"citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:398bce33420f52c4e2d7acbc8b4237238c8e18a6c4a60177683da9866336371d","observation_id":"ebf1d7cf-2b22-48f8-97c5-989a2cedf960","resolution":{"observed_at":"2026-08-14T15:40:23.491598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-14T15:40:22.196318Z","title":"arXiv preprint arXiv:2408.00118 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.196318Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:e2b94926cfec0fd5a8752f9d42871fa8276bc272abc1bb8d16db6bfe5c69a3e7","observation_id":"b8ad8321-5d4f-47d3-a567-5808432c5690","resolution":{"observed_at":"2026-08-14T15:40:22.196318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:40:22.203126Z","title":"Nature645(8081), 633–638 (2025).https://doi.org/10.1038/s41586-025-09422-z,http://dx","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.203126Z"},"links":{"citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:abf354f3ed22e2e43d810e185e65b3562844ab5e62f444e51128cbc118eef0af","observation_id":"c167fe86-a646-46ec-8322-762a47c04df8","resolution":{"observed_at":"2026-08-14T15:40:22.203126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:40:22.209126Z","title":"pre- ferring shorter thinking chains for improved llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.209126Z"},"links":{"citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:721d82d2e9f8a76b6190e0f085de4636089300108189ff8450dde5f2bac94772","observation_id":"71ab9d94-9509-4867-b6f8-2b12e5127677","resolution":{"observed_at":"2026-08-14T15:40:22.209126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:40:23.467667Z","title":"In: The Fourteenth Inter- national Conference on Learning Representations (2026),https://openreview","venue":null,"work_id":"313167c0-e8d5-413e-8ab4-c6cb8bbcaed6","year":2026},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.215354Z"},"links":{"citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:49746123949dc30c72c3ef00510e36252fdea64c7db76cdc47094f192cce120e","observation_id":"dce71d75-8e6a-4879-9609-24d2d8e8ea70","resolution":{"observed_at":"2026-08-14T15:40:23.473292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:40:23.451288Z","title":null,"venue":null,"work_id":"68753c26-c443-40e2-914f-cb83bf47353d","year":2026},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.221895Z"},"links":{"citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:d5154a395d9211337c0d206273445412f7374aa5e9c38dd2bbe9a2ebfbf6ec63","observation_id":"1431cff5-861d-4542-97df-30a83cda322a","resolution":{"observed_at":"2026-08-14T15:40:23.456227Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:40:23.434444Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2026)","venue":null,"work_id":"ecd9a0f5-f5d7-4d2f-a8b7-5de79759bdd3","year":2026},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.227435Z"},"links":{"citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:2d07a1aaa82ca1fac765600726d72836c7925049f29aeebd868e56062e9788c8","observation_id":"b26da899-3e01-432e-bcb1-63c107e0ea75","resolution":{"observed_at":"2026-08-14T15:40:23.439702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:40:23.416278Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence","venue":null,"work_id":"198ce9fc-39ce-456b-904a-ec61ffe3817c","year":2025},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.233184Z"},"links":{"citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:ae8bb42e6670a94e2df7eeecd08c7eeb13ea235a2d2edb6d03c30ad993ae11b1","observation_id":"94effb2d-3ea3-45a5-bdb6-51465b73bae9","resolution":{"observed_at":"2026-08-14T15:40:23.421959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:40:23.396498Z","title":"Transactions on Machine Learning Re- search (TMLR) (2026) 16 K","venue":null,"work_id":"28287f2c-3f2a-47de-9d49-fb2a70557b84","year":2026},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.239412Z"},"links":{"citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:6f073c89e3c00a1563d3375193e3020c4f6e55ad253143d711aefa9509f979fb","observation_id":"1bac5ce9-d9ce-4f25-8c19-c0abeef21e1d","resolution":{"observed_at":"2026-08-14T15:40:23.402857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:40:23.376984Z","title":"In: The Thirty-ninth Annual Conference on Neural Information Processing Systems Datasets and Benchmarks Track (2026), https://openreview.net/forum?id=SSF4qgsNYE","venue":null,"work_id":"9a78b8e0-7bc6-4bcd-a950-1fa3b65418cc","year":2026},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.245607Z"},"links":{"citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:36bfc01cc16a56d907680829c05003745c433f76fb84eee1ccdfc0e77baaa1f7","observation_id":"94d9d133-0221-4577-b26d-72cd84f0b53a","resolution":{"observed_at":"2026-08-14T15:40:23.384098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:40:22.251999Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.251999Z"},"links":{"citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:266fcc68b937da68629afb1d06022ddc455a8fe76f2958fde85ebb3616de16b5","observation_id":"331b1625-dbc1-4104-b370-44f3383ab879","resolution":{"observed_at":"2026-08-14T15:40:22.251999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15401","last_updated":"2024-05-23T11:42:08Z","snapshot_observed_at":"2026-08-16T15:20:46.756130Z","submitted_at":"2023-06-27T11:54:57Z","title":"Explainable Multimodal Emotion Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15401","snapshot_observed_at":"2026-08-14T15:40:22.258726Z","title":"arXiv preprint arXiv:2306.15401 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.258726Z"},"links":{"cited_paper":"/paper/2306.15401","citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:2974984a4aead574a4e2c5bc0ea2a28ff1c6127f261874fc15a9eff08bc27105","observation_id":"b76175d4-b330-4aa5-b3ed-76396b6e712d","resolution":{"observed_at":"2026-08-14T15:40:22.258726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:40:23.353211Z","title":"Advances in Neural Information Processing Systems36, 34892–34916 (2023)","venue":null,"work_id":"b926cc67-55c3-45cb-baca-a75c6cc5cf47","year":2023},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.266135Z"},"links":{"citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:483dd5963261be7d80e5d246f29a821f5eb436b3034927b280145b55b074a482","observation_id":"d2008d3f-f1e2-4300-8549-b3ef134667e3","resolution":{"observed_at":"2026-08-14T15:40:23.361120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-14T15:40:22.271573Z","title":"arXiv preprint arXiv:2407.21783 (2024),https://ai.meta.com/blog/meta-llama-3-1/","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.271573Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:3d2c076b133e7e28994d466ee1c5c15894fd16f96ad0eb6c4f00cc640a37d2fe","observation_id":"0c1bdeb2-c3ea-4cfd-bde9-562187734be3","resolution":{"observed_at":"2026-08-14T15:40:22.271573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:40:23.334875Z","title":"International Conference on Learning Representations (ICLR) (2026)","venue":null,"work_id":"462e737f-1b99-4747-9314-600ba1428f9a","year":2026},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.277997Z"},"links":{"citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:9248ab18f165036cbe5ed41ab5ad1afaadb580998e500454ea51ab0329e514a6","observation_id":"cc2c9d48-c62e-4373-9422-43e9d060b4b9","resolution":{"observed_at":"2026-08-14T15:40:23.340132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.12018","last_updated":"2026-06-10T12:44:02Z","snapshot_observed_at":"2026-08-17T19:44:44.329059Z","submitted_at":"2026-06-10T12:44:02Z","title":"MODF-SIR: A Multi-agent Omni-modal Distilled Framework for Social Intelligence Reasoning","version":1},"cited_work":{"arxiv_id":"2606.12018","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.12018","snapshot_observed_at":"2026-08-14T15:40:22.896872Z","title":"MODF-SIR: A Multi-agent Omni-modal Distilled Framework for Social Intelligence Reasoning","venue":"cs.AI","work_id":"510b9d20-3ee9-4cd9-80f8-eb2cdf04ce90","year":2026},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.283540Z"},"links":{"cited_paper":"/paper/2606.12018","citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:fffde8b7e8282566e92eddaeabb7b3b6cf9cc339722d1bd5013bf2229b41c13d","observation_id":"48de3eb2-7ea5-465d-ad4e-fd162ee927a7","resolution":{"observed_at":"2026-08-14T15:40:22.902794Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:40:23.317319Z","title":"In: Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing","venue":null,"work_id":"eafcffc6-7777-4af4-b0ad-069cb3fa21f2","year":2025},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.289268Z"},"links":{"citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:c7f2eee92b763ef3cca82a59ee2a009a4afba4223a9b663ada40f8097ec429ad","observation_id":"5bf02b1c-97f5-4650-bfbd-5f8c224913fc","resolution":{"observed_at":"2026-08-14T15:40:23.322801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:40:23.300177Z","title":null,"venue":null,"work_id":"9c1c33b1-173d-4923-86f5-f87b6063fa36","year":2024},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.295407Z"},"links":{"citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:27ac4e388f1fb35bbe460551dbff835d61640eba317ef402a535a3efce2acb0f","observation_id":"05fc6fc0-db95-4e07-b562-4ee30c328158","resolution":{"observed_at":"2026-08-14T15:40:23.305487Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:40:23.278476Z","title":null,"venue":null,"work_id":"40f01cea-c6a4-456b-93ca-790ec56bf687","year":2022},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.301379Z"},"links":{"citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:95294205bcc167aba6dad2ec72871103a80d8d2c49bc5dd8dfd4cbdcd7479683","observation_id":"c46bf565-a18f-4c7b-8d69-717186081ca5","resolution":{"observed_at":"2026-08-14T15:40:23.287468Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:40:23.257888Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence","venue":null,"work_id":"4bd1f757-3dac-44d2-80e6-6a05c1012cd1","year":2026},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.308927Z"},"links":{"citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:9f8932ac202e1fd2cd0c59e01e0e1174680d484361df9e6c3e6da974453aa325","observation_id":"6ead7a3d-e8ed-448d-a535-028650533434","resolution":{"observed_at":"2026-08-14T15:40:23.264045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-14T13:05:43.952056Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-08-14T15:40:22.314683Z","title":"arXiv preprint arXiv:2604.15804 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.314683Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:16116b833f2c8eae141fc34668a16c1d2d3077e58bc442c46527ee07d4a4e5a3","observation_id":"a5661164-765a-40f0-a528-c1ce20f39c39","resolution":{"observed_at":"2026-08-14T15:40:22.314683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:40:22.320829Z","title":"Proceedings of the AAAI Conference on Arti- ficial Intelligence40(3), 2029–2037 (Mar 2026).https://doi.org/10.1609/aaai","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.320829Z"},"links":{"citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:cf1127c27a91de4d8452db640467ecf7ca5acf24959e327e6a6086189b2f61d1","observation_id":"b2fdcf59-6add-4887-8a55-43043127a5c1","resolution":{"observed_at":"2026-08-14T15:40:22.320829Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-14T15:40:22.330193Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.330193Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:2fa8ced557c96bf90b1705c0f3481a0c2f87fc2d81af47a06817f2581e1f9e52","observation_id":"4de6f7d6-9041-438e-aa85-4b7b2131ab37","resolution":{"observed_at":"2026-08-14T15:40:22.330193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2026.37076","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:40:22.827227Z","title":"IEEE Transactions on Affective Computing pp","venue":null,"work_id":"3f73a843-c61b-4e4a-85ee-c98b7b663dd2","year":2026},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.338534Z"},"links":{"citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:4d8f1e4d1db84c98b0b7b7f32f296c18857176560b7332e01887b12c54c37260","observation_id":"ef2d15aa-22c3-406c-a6a3-99f58c4eed8f","resolution":{"observed_at":"2026-08-14T15:40:22.837582Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:40:23.237838Z","title":"NIPS ’22, Curran Associates Inc., Red Hook, NY, USA (2022) Reasoning for Social AV-QA: Where Do We Stand? 17","venue":null,"work_id":"bd7feaee-ae5a-4f18-9625-36fa4a375cd4","year":2022},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.346441Z"},"links":{"citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:5142048facf491183ee34fcfcee9bc4b461193a2004e7a3a99abac4720bf0c62","observation_id":"864397c2-61c0-4e69-88c3-bd32fbf521c0","resolution":{"observed_at":"2026-08-14T15:40:23.245065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:40:23.218119Z","title":null,"venue":null,"work_id":"52fb87ff-67b3-4dc4-8cb8-000153ba62e1","year":2023},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.354610Z"},"links":{"citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:2588f53611c9ae9aa1114e9713629d8bd87be86af088685034e4dced3b799089","observation_id":"99d44657-f5ad-439d-8113-0272b25107f4","resolution":{"observed_at":"2026-08-14T15:40:23.224191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:40:23.199224Z","title":"In: The Fourteenth International Conference on Learning Representations (2026),https://openreview.net/forum?id=KttCXdjj4w","venue":null,"work_id":"afff0db0-5c58-45e9-aec2-c778eb57450a","year":2026},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.361475Z"},"links":{"citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:b422eae1e74ab85c8325c9e9cc369ba8fc9414668347fbb91c78ea285e42e651","observation_id":"9a5be136-94c5-48f3-9271-805bdd1e91cc","resolution":{"observed_at":"2026-08-14T15:40:23.205764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-14T15:40:22.370138Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.370138Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:f73e60b6ef039be19be70129dcf2016287e5304cc8dc9f0e4bca32c8f08ab09c","observation_id":"9dde63e2-6531-4509-8203-9b8cbd09f804","resolution":{"observed_at":"2026-08-14T15:40:22.370138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-17T10:14:59.808826Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-08-14T15:40:22.379357Z","title":"arXiv preprint arXiv:2506.21277 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.379357Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:bfe1f86d03d80c0e7f6375551a82cf49c1562eec169bdb01ca73fee7acdf36a7","observation_id":"311bef0b-dcd4-4b30-829b-aeffeb57682e","resolution":{"observed_at":"2026-08-14T15:40:22.379357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:40:23.178332Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"6365d9ae-bcf5-4251-962b-36ec12451197","year":2019},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.387022Z"},"links":{"citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:1310e2fe0600d49d184a3e37751d7f149a3a303557bd793a9ebb8ed4a71eecb1","observation_id":"146a99af-8849-4886-a608-74b881604adc","resolution":{"observed_at":"2026-08-14T15:40:23.185468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:40:23.156364Z","title":"In: The Fourteenth International Confer- ence on Learning Representations (2026),https://openreview.net/forum?id= xindJJLSr1","venue":null,"work_id":"747461b5-aa3f-4518-96a5-0b94e2194226","year":2026},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.392688Z"},"links":{"citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:7a8bff82fe83e645edafc6f59692c2eb1be4159d80f037be08d89f3e5edb053c","observation_id":"c4488e5e-0328-4d8b-b5fb-e61f1fcafda1","resolution":{"observed_at":"2026-08-14T15:40:23.163274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:40:23.137508Z","title":"In: Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing: System Demonstrations","venue":null,"work_id":"cacb23bb-90c7-42be-86d8-381c700d3a3a","year":2023},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.398106Z"},"links":{"citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:0e3c552542f6890c35dae8cc33c828687a93519b4eb928841d2f6bf5365f8b41","observation_id":"7595718e-6042-458e-b0b3-44aa283e9948","resolution":{"observed_at":"2026-08-14T15:40:23.142770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05379","last_updated":"2025-03-10T07:11:14Z","snapshot_observed_at":"2026-08-16T12:52:11.523420Z","submitted_at":"2025-03-07T12:46:42Z","title":"R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05379","snapshot_observed_at":"2026-08-14T15:40:22.407728Z","title":"arXiv preprint arXiv:2503.05379 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.407728Z"},"links":{"cited_paper":"/paper/2503.05379","citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:c63518781b0795457a94b9acce171471b5d3ea9cd160a107b026ddde025e13ef","observation_id":"1351b028-c51b-4d92-a936-9235dfbebfbb","resolution":{"observed_at":"2026-08-14T15:40:22.407728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:40:22.415414Z","title":"arXiv preprint arXiv:2512.09616 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.415414Z"},"links":{"citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:803933cd67cad3349c6b11ba310cfd1f10975d4a306bb6b045cad2368be15840","observation_id":"3aecfed7-7764-4b78-9b86-e7a58187b973","resolution":{"observed_at":"2026-08-14T15:40:22.415414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21277","last_updated":"2025-05-21T06:08:31Z","snapshot_observed_at":"2026-08-16T05:05:38.872147Z","submitted_at":"2025-04-30T03:14:28Z","title":"Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21277","snapshot_observed_at":"2026-08-14T15:40:22.421903Z","title":"arXiv preprint arXiv:2504.21277 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.421903Z"},"links":{"cited_paper":"/paper/2504.21277","citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:fcec0f636d5072648df3fec1d74f8bfdd7661c70f5d3dff415eac7add608e080","observation_id":"b47a2d16-4a8f-482e-ac4d-67e3d64bc694","resolution":{"observed_at":"2026-08-14T15:40:22.421903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:40:22.428261Z","title":"arXiv preprint arXiv:2505.17862 (2025) 18 K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T15:40:22.428261Z"},"links":{"citing_paper":"/paper/2608.13239"},"observation_digest":"sha256:dc287964663f80f99a104c2f4ffe0f6addf48e54830e0f5691cd65323433caad","observation_id":"d9427a58-448b-418a-82a9-a38044e6c743","resolution":{"observed_at":"2026-08-14T15:40:22.428261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.13239","last_updated":"2026-08-13T13:44:35Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T19:02:27.249182Z","submitted_at":"2026-08-13T13:44:35Z","title":"Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2608.13239."}