{"as_of":"2026-08-14T22:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:366bbcdd42d1766d2df9099326f325130e7f9f258fcfc2cbae22c1bb8452380f","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T18:13:44.573450Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06930/citation-record","integrity":"/paper/2608.06930/integrity","json":"/paper/2608.06930/citation-record.json","paper":"/paper/2608.06930"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.001303Z","title":"Avocado: An audiovisual video captioner driven by temporal orchestration.arXiv preprint arXiv:2510.10395, 2025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.001303Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:ad421d5cd3cd54022e9ae649c98e4924194ca38afacb5cf055555b1f975dd98c","observation_id":"4eaed5f7-1f2a-4ff8-8f8f-92924844fd08","resolution":{"observed_at":"2026-08-10T18:13:44.001303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.012944Z","title":"Ugc-videocaptioner: An omni ugc video detail caption model and new benchmarks.arXiv preprint arXiv:2507.11336, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.012944Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:8d50b940b28dfd336b745bbcdf0f290e7fc9d0ea8ea0a25be6f74a02cb88b35f","observation_id":"b695bdef-a788-4514-949d-8065a0a98e1f","resolution":{"observed_at":"2026-08-10T18:13:44.012944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.020242Z","title":"Daily-omni: Towards audio-visual reasoning with temporal alignment across modalities.arXiv preprint arXiv:2505.17862, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.020242Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:bf5622e627c8c913652002106dc2acd2cc6e6a17d09254ed08732e65a14f45ac","observation_id":"ad1b155c-49ef-45af-b7b2-78dea5511969","resolution":{"observed_at":"2026-08-10T18:13:44.020242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12782","last_updated":"2025-05-17T09:49:22Z","snapshot_observed_at":"2026-08-09T00:20:10.216953Z","submitted_at":"2025-02-18T11:42:17Z","title":"VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12782","snapshot_observed_at":"2026-08-10T18:13:44.027540Z","title":"Vidcapbench: A comprehensive benchmark of video captioning for controllable text-to-video generation.arXiv preprint arXiv:2502.12782, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.027540Z"},"links":{"cited_paper":"/paper/2502.12782","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:69743742ff07a4b154b42410e28b365ff7ec0b1b55cef6e9063f78029b3a0937","observation_id":"f454879b-db8d-4894-b6a7-98084bef545c","resolution":{"observed_at":"2026-08-10T18:13:44.027540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:47.156141Z","title":"Sharegpt4video: Improving video understanding and generation with better captions.Advances in Neural Information Processing Systems, 37: 19472–19495, 2024","venue":null,"work_id":"1e690184-3f6b-48a3-822f-fd280333a921","year":2024},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.035846Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:2d55f601828c7be75a5987d12742dc39953ffc6d2fc17fdf7d81b107557c85a5","observation_id":"8f6e4ae1-519f-4569-be74-61cf0eed85a9","resolution":{"observed_at":"2026-08-10T18:13:47.162755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.043255Z","title":"Mavors: Multi-granularity video representation for multimodal large language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.043255Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:64576cce2ab4b4d4c66787f50ef7c24c2135ab61c489a24aeff8a31c4c777cc0","observation_id":"55a344b0-2078-444f-9837-3581bfcb57db","resolution":{"observed_at":"2026-08-10T18:13:44.043255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.051144Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.051144Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:515a4866fbbf0996c8089baad3e377afb11cf838009c60cb16386483b4e1cb7f","observation_id":"5c73a9e0-e967-446c-a679-d61cfd231a08","resolution":{"observed_at":"2026-08-10T18:13:44.051144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-12T23:31:58.325076Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-10T18:13:44.059127Z","title":"Tarsier: Recipes for training and evaluating large video description models.arXiv preprint arXiv:2407.00634, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.059127Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:9a1b70ea7337d314a34ad2757ce2623352640176084cb1ee4758a1a9d297a5d9","observation_id":"90db9274-bbf3-46ad-8514-45a615392547","resolution":{"observed_at":"2026-08-10T18:13:44.059127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-10T20:27:34.844428Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-10T18:13:44.066103Z","title":"Tarsier2: Advanc- ing large vision-language models from detailed video description to comprehensive video understanding.arXiv preprint arXiv:2501.07888, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.066103Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:d99099ac53f4a380acbf8867b7c4cfb34e880c7563242524e816239529404b17","observation_id":"b84cf9f9-f405-441b-9a80-a8a0db9a6853","resolution":{"observed_at":"2026-08-10T18:13:44.066103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.074176Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.074176Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:b969c0828e6545bb85aa9a58923071337dbadecc8f8bb99d49630d95acb64c75","observation_id":"ac750a63-35b8-467a-9019-cfa9d9a1d905","resolution":{"observed_at":"2026-08-10T18:13:44.074176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:47.102460Z","title":"Advancing high-resolution video-language representation with large-scale video transcriptions","venue":null,"work_id":"21a572d7-40de-4004-80f7-b7948e53e75d","year":2022},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.080659Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:33c72c83035eb850d4b9b4ae1dbe7515e419625f142aa61f7f83c9b2c7c68f52","observation_id":"727dae58-6d8b-4478-bb13-886fcd349312","resolution":{"observed_at":"2026-08-10T18:13:47.108399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.087226Z","title":"video-salmonn 2: Captioning-enhanced audio-visual large language models.arXiv preprint arXiv:2506.15220, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.087226Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:f28cf8b6dd0f4ae66426b9781a40e4f524fc7785ddb0bbbeb129ea0013a1bdcb","observation_id":"6995e3e9-3e81-4806-af86-eef40d176bdb","resolution":{"observed_at":"2026-08-10T18:13:44.087226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18325","last_updated":"2025-03-17T08:14:35Z","snapshot_observed_at":"2026-08-12T22:16:19.127822Z","submitted_at":"2024-10-23T23:36:06Z","title":"AVHBench: A Cross-Modal Hallucination Benchmark for Audio-Visual Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18325","snapshot_observed_at":"2026-08-10T18:13:44.093438Z","title":"Avhbench: A cross-modal hallucination benchmark for audio-visual large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.093438Z"},"links":{"cited_paper":"/paper/2410.18325","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:4d6aebaf44dd1c701c24ee69b07f2b347dbbffcb8554dd7bc2d0d1464372ffcd","observation_id":"7f752d0b-4aad-460d-9aba-c565c4d88bb7","resolution":{"observed_at":"2026-08-10T18:13:44.093438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:47.081185Z","title":"Longvale: Vision-audio-language-event benchmark towards time-aware omni-modal perception of long videos","venue":null,"work_id":"8f6418c5-b446-40e9-b4e2-9464c13b1583","year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.099582Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:d34677a46e84947b78af2dc612bf8769e44c7179c072680f07e33d43e91ca9c2","observation_id":"70ff3cbf-52e2-4513-b5d7-e931862558b8","resolution":{"observed_at":"2026-08-10T18:13:47.086591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22045","snapshot_observed_at":"2026-08-10T18:13:44.106889Z","title":"Miti- gating audiovisual mismatch in visual-guide audio captioning.arXiv preprint arXiv:2505.22045, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.106889Z"},"links":{"cited_paper":"/paper/2505.22045","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:92adba695ef0edb7a7900b694a6e34951c9851d547008d5d885677bcc13cbf60","observation_id":"8db4405e-fa54-4f54-95d9-ff440f26235c","resolution":{"observed_at":"2026-08-10T18:13:44.106889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-10T18:13:44.113320Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.113320Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:4768c411c2daebb22034301af3d67c15981abaf829106fbf8915a305fef4e51e","observation_id":"a402971b-163d-41f1-bf6a-5779e77e4a33","resolution":{"observed_at":"2026-08-10T18:13:44.113320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-10T18:13:44.120212Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.120212Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:8f84b3cf809bd39de151dca4f63c071cdd2a2410ac5436adf18aa002d02a990f","observation_id":"fafedc81-20fb-4608-872c-4b5035d3bde9","resolution":{"observed_at":"2026-08-10T18:13:44.120212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/n18-2125","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.626564Z","title":"Watch, listen, and describe: Globally and locally aligned cross-modal attentions for video captioning","venue":null,"work_id":"7453fde5-6d61-474d-b7a2-f1303a1373ad","year":2018},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.126805Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:5c5835c704efdd0109b6cb3c349ca72b9875af2579f5ccecb67404b67f6cf514","observation_id":"87b8dd1b-90a8-4b20-bc27-6bb85e24b4a2","resolution":{"observed_at":"2026-08-10T18:13:44.635267Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14084","last_updated":"2021-10-01T15:13:27Z","snapshot_observed_at":"2026-08-13T18:03:15.705177Z","submitted_at":"2021-09-28T23:01:51Z","title":"VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.14084","snapshot_observed_at":"2026-08-10T18:13:44.133036Z","title":"Videoclip: Contrastive pre-training for zero- shot video-text understanding.arXiv preprint arXiv:2109.14084, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.133036Z"},"links":{"cited_paper":"/paper/2109.14084","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:ea9b95b1488d821c64531d29250be575f39ee3d2835ae0a22b21ca7e1a4e30f8","observation_id":"e10c871d-faef-49c8-bac8-ad08c41aec11","resolution":{"observed_at":"2026-08-10T18:13:44.133036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-10T18:13:44.140160Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.140160Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:921532fe77e9024a3a82bf74adaf44074ef853a53f9832905c8732fcce984cbd","observation_id":"3a17029f-7952-4eac-a5f8-50f77b513d43","resolution":{"observed_at":"2026-08-10T18:13:44.140160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.146443Z","title":"Glave-cap: Global-local aligned video captioning with vision expert integration.arXiv preprint arXiv:2509.11360, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.146443Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:e7d743820c3293535f0e28fc11af42e497cabcc453b9ac50e5c542cddc200607","observation_id":"2d47876c-b084-4857-a211-94c6eba7760b","resolution":{"observed_at":"2026-08-10T18:13:44.146443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-10T18:13:44.151110Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.151110Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:6976459d9f62e2005e3ee7f64abf7323e9d91ab12cdd59b1357a4b4bb507d523","observation_id":"f8f1a29e-aef0-4ac8-9db6-e8e868898a3a","resolution":{"observed_at":"2026-08-10T18:13:44.151110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07089","last_updated":"2025-06-02T09:38:26Z","snapshot_observed_at":"2026-08-07T21:01:40.617151Z","submitted_at":"2025-04-09T17:58:58Z","title":"OmniCaptioner: One Captioner to Rule Them All","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07089","snapshot_observed_at":"2026-08-10T18:13:44.157674Z","title":"Omnicaptioner: One captioner to rule them all.arXiv preprint arXiv:2504.07089, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.157674Z"},"links":{"cited_paper":"/paper/2504.07089","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:92358d9cc3cb0ff807e9e71e6e422a2c7042842a436ff23913c785c3fe87c163","observation_id":"ead60c4d-46c1-4950-977f-efa478de054f","resolution":{"observed_at":"2026-08-10T18:13:44.157674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.163332Z","title":"Omni-captioner: Data pipeline, models, and benchmark for omni detailed perception.arXiv preprint arXiv:2510.12720, 2025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.163332Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:f9728594101b1c4f8966900965f4fd733a2e4edd96abebc6eb6fd93504b859ee","observation_id":"d1c38d65-50d3-4629-b59f-5b52c5a203e4","resolution":{"observed_at":"2026-08-10T18:13:44.163332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-10T18:13:44.169838Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.169838Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:597b4537e59968fcb129fc58d0c1cc7009efc1ff9f6ee13a675eb3ec62c7505b","observation_id":"aab17aee-273f-41a8-9111-9ea95809ed00","resolution":{"observed_at":"2026-08-10T18:13:44.169838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-10T18:13:44.176917Z","title":"Video-r1: Reinforcing video reasoning in mllms.arXiv preprint arXiv:2503.21776, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.176917Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:30aa89d0953453d3c0012a086ddc2e7b0e3b619a313cf09f6e8001498e0f95ab","observation_id":"91ab4e8d-8701-43e7-a6f1-180c2e0142ef","resolution":{"observed_at":"2026-08-10T18:13:44.176917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.16918","last_updated":"2026-04-28T12:04:04Z","snapshot_observed_at":"2026-08-12T12:30:05.677115Z","submitted_at":"2025-12-18T18:59:55Z","title":"AdaTooler-V: Adaptive Tool-Use for Images and Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.16918","snapshot_observed_at":"2026-08-10T18:13:44.183615Z","title":"Adatooler-v: Adaptive tool-use for images and videos.arXiv preprint arXiv:2512.16918, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.183615Z"},"links":{"cited_paper":"/paper/2512.16918","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:f2cb84c435dad6b225858ce2016df8f197b9c33f639afe5adf520541b0d90923","observation_id":"1dfeba4d-990f-4466-961f-7991cdc82a8b","resolution":{"observed_at":"2026-08-10T18:13:44.183615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.190682Z","title":"Deepvideo-r1: Video rein- forcement fine-tuning via difficulty-aware regressive grpo.arXiv preprint arXiv:2506.07464, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.190682Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:ccb16d2cc32a2a655aa684827986dd66510afab1d88e22b888b9b36bfd64a721","observation_id":"0e486e27-48ba-4008-87db-37a63dcf1e18","resolution":{"observed_at":"2026-08-10T18:13:44.190682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.197366Z","title":"Editthinker: Unlocking iterative reasoning for any image editor","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.197366Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:5414b25f2d772f53c016fb7e06f1ed1a92862aa64b452c5e64493a1ed5d1409e","observation_id":"89671b3f-be56-4556-bfb1-d94ce96e8412","resolution":{"observed_at":"2026-08-10T18:13:44.197366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.204027Z","title":"Sophiavl-r1: Reinforcing mllms reasoning with thinking reward.arXiv preprint arXiv:2505.17018, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.204027Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:d0642ac9717b3d89c0e2aa6b3a035de9b2873ea14a95e322b15af89c545a47e0","observation_id":"7e3a51c8-22b5-4d13-a606-cc7a0e510022","resolution":{"observed_at":"2026-08-10T18:13:44.204027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09965","last_updated":"2025-06-19T03:46:55Z","snapshot_observed_at":"2026-07-31T21:40:49.363128Z","submitted_at":"2025-06-11T17:41:50Z","title":"Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09965","snapshot_observed_at":"2026-08-10T18:13:44.209331Z","title":"Reinforcing spatial reasoning in vision-language models with interwoven thinking and visual drawing.arXiv preprint arXiv:2506.09965, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.209331Z"},"links":{"cited_paper":"/paper/2506.09965","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:d46ab1bbcc9c0dbb8fc51f56b35a45ba2b852a0c46864f4fc5a2405c9a3e8c2d","observation_id":"3ec3c7c0-87f4-447b-885a-edc9ca334b31","resolution":{"observed_at":"2026-08-10T18:13:44.209331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-14T02:35:09.273544Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-10T18:13:44.215349Z","title":"Time-r1: Post-training large vision language model for temporal video grounding.arXiv preprint arXiv:2503.13377, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.215349Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:f36461b3ee4b9bcf03b9824ba8c86ae871c03dfdb93d08443a4e5ca21bee7e0c","observation_id":"cf7d5b55-0444-40c4-aacb-a628a9681f73","resolution":{"observed_at":"2026-08-10T18:13:44.215349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.03043","last_updated":"2026-04-28T12:07:36Z","snapshot_observed_at":"2026-08-13T15:37:47.305433Z","submitted_at":"2025-12-02T18:59:52Z","title":"OneThinker: All-in-one Reasoning Model for Image and Video","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.03043","snapshot_observed_at":"2026-08-10T18:13:44.221576Z","title":"Onethinker: All-in-one reasoning model for image and video.arXiv preprint arXiv:2512.03043, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.221576Z"},"links":{"cited_paper":"/paper/2512.03043","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:e2d54fe9ee802eef4711bb9e5908ee59379cb7c9fbad36f4fc3624428ae3b7c1","observation_id":"65539722-4660-4024-be93-223a12fa8d76","resolution":{"observed_at":"2026-08-10T18:13:44.221576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-10T18:13:44.228889Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforce- ment fine-tuning.arXiv preprint arXiv:2504.06958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.228889Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:cfaae8aadeba5bf653c25d065ff8753bac84891a34037e3fdbaeabe1672c68fc","observation_id":"2eb3994f-034a-49ca-a654-13259944ce9d","resolution":{"observed_at":"2026-08-10T18:13:44.228889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01725","snapshot_observed_at":"2026-08-10T18:13:44.235558Z","title":"Videocap-r1: Enhancing mllms for video captioning via structured thinking.arXiv preprint arXiv:2506.01725, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.235558Z"},"links":{"cited_paper":"/paper/2506.01725","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:6b13217435c4192edb970ed25181623a277a6b3494d121275c30db25f2925989","observation_id":"53fcffc3-aa5f-49b5-ac92-20dd6ee28176","resolution":{"observed_at":"2026-08-10T18:13:44.235558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:47.062066Z","title":"Exploring the role of audio in video captioning","venue":null,"work_id":"43a04fe4-5d56-417d-a2bf-0222480024d6","year":2024},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.241601Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:2c35ff66794451a5c65e02c856c0cffae6d5e2cf6c563547481c7bf38c8dea35","observation_id":"d031b374-8983-4f7e-a325-cc8741da424e","resolution":{"observed_at":"2026-08-10T18:13:47.067484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:47.042673Z","title":"Hybrid transformers for music source separation","venue":null,"work_id":"a3a8b4a6-a13d-41b5-97e8-87d4653c56d2","year":2023},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.247461Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:7dc5088a03a1420cb3241c548292be837e9fde978d2032047d661a5dfc65fa02","observation_id":"81e8b0ea-9029-44e0-8c6e-06c0df6bdacb","resolution":{"observed_at":"2026-08-10T18:13:47.049145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.255613Z","title":"Audio-visual event localization in unconstrained videos","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.255613Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:79c01ce7f184183dda3a1924ffaafc12d2a9d2fff65eb68913f1b9d7696fb73d","observation_id":"cc0ed116-12d4-4b94-929f-bb14edf82074","resolution":{"observed_at":"2026-08-10T18:13:44.255613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:47.012993Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"5f888f18-0cd2-4d24-bee2-49512d6f2b80","year":2020},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.261995Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:e6832f73020b01f9fc1428e0a4517d86ac1e2c9bfeeea163fa0b4cb7242ecba3","observation_id":"f3944060-20a1-4e43-ac79-d894f5e3ef54","resolution":{"observed_at":"2026-08-10T18:13:47.018344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.268021Z","title":"Condensed movies: Story based retrieval with contextual embeddings","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.268021Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:45f1d90ddebd090d547d467217c4dd2488032616bdbab3ae74a18a0eb640b3c7","observation_id":"3ca62a8c-3c7f-419f-b375-76f43901be93","resolution":{"observed_at":"2026-08-10T18:13:44.268021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.276994Z","title":"Avqa: A dataset for audio-visual question answering on videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.276994Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:c1d724f62c4ffaee2143024b1615ca8b4199ca9e957056c0e71e72010e83b626","observation_id":"a4d9dd4f-6e26-4315-92f0-725f21550be2","resolution":{"observed_at":"2026-08-10T18:13:44.276994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.973927Z","title":"Movienet: A holistic dataset for movie understanding","venue":null,"work_id":"c29f068a-864f-4647-8261-841e8a603ea0","year":2020},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.284058Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:6b275f9e6deb63202179881caa628cb866b26a93045dde0bf90b0ff45926c630","observation_id":"fee2fdf0-5625-4f0b-a12f-fb4d2404f25a","resolution":{"observed_at":"2026-08-10T18:13:46.978977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.957507Z","title":"A dataset for movie description","venue":null,"work_id":"41236320-256f-4add-9c71-50e2cc360eaf","year":2015},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.292387Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:5da06f0c6c9627af93cde3c0fe50502be5ff7ec57277e4eac4a217584d38b820","observation_id":"c4d13c8f-2283-41b8-ba93-d06bd766d3e0","resolution":{"observed_at":"2026-08-10T18:13:46.962720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.941415Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":"b86b9635-ea7a-49e3-b57a-57777a8a7866","year":2024},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.300777Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:fd0cd6bd096a1ff31eb7197cfc7fd6f3a8ef270b65c1d0ef0c4a351336f9ec32","observation_id":"09d3fbeb-410e-4146-9ec5-ad05891eb23f","resolution":{"observed_at":"2026-08-10T18:13:46.946632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.924156Z","title":"Time-r1: Post-training large vision language model for temporal video grounding","venue":null,"work_id":"8f217273-0269-43e0-9f6c-f7c45e38a948","year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.313655Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:b93fe8669c3cf0ebbd4f874b3a2969fff7f305562e335ed4793618915df5d2ec","observation_id":"cdd33149-e7cc-4cc7-89a3-72bc5fc4f766","resolution":{"observed_at":"2026-08-10T18:13:46.929111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-13T14:43:39.859904Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24164","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24164","snapshot_observed_at":"2026-08-10T18:13:44.857313Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","venue":"cs.CL","work_id":"533dbd2e-73c0-4397-9319-9314d0eafa0b","year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.320002Z"},"links":{"cited_paper":"/paper/2505.24164","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:8efa150b6069eb0a575a3d23e27107d107c1bcfaa5dac18052fc563d1972d5a1","observation_id":"41f95256-3d3a-4c1f-a884-73c828d10848","resolution":{"observed_at":"2026-08-10T18:13:44.864443Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-13T05:30:51.244198Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-10T18:13:44.329322Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.329322Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:d3ad097fa73269100fb02ce735b4f8833e250aaa505b0ccea757f2a8a6f51d2b","observation_id":"d6ea50e2-06d0-4b15-981a-95988c63ed04","resolution":{"observed_at":"2026-08-10T18:13:44.329322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.336856Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1 (2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.336856Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:88017e936b7e1da4c3c132b469617ebe50c32e6a6d1364e21bf7d3cee92cd126","observation_id":"324bbfe1-68ca-488a-968a-de6c43b9bfcf","resolution":{"observed_at":"2026-08-10T18:13:44.336856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.342904Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.342904Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:389a785c8fed238e6b6ad09bc79eebd1a8db8fb5713e255c4c074f7f71cbd51e","observation_id":"fa408bef-362d-41bb-b75f-70b2b82f91e1","resolution":{"observed_at":"2026-08-10T18:13:44.342904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.369645Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.369645Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:d496105a0c66b74182eaa67bc009a828e4e8d43ba4294fb7a75f4302553d46fe","observation_id":"455e53d5-8b79-462a-8263-e33b9bceb9df","resolution":{"observed_at":"2026-08-10T18:13:44.369645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-08-12T17:56:21.544451Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-10T18:13:44.376026Z","title":"Vbench-2.0: Advancing video generation benchmark suite for intrinsic faithfulness.arXiv preprint arXiv:2503.21755, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.376026Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:90b32e8b03731054d5e65640c16bd327212bf006ca55f29cebdbd888eec1767c","observation_id":"367cf444-21a9-45a3-bae8-ce99e94b6814","resolution":{"observed_at":"2026-08-10T18:13:44.376026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-08-10T18:13:44.385618Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context.arXiv preprint arXiv:2506.21277, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.385618Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:f60796ce436441faa138875cf5dfab6849b604d2c55770b7e1c5ffa0cf440917","observation_id":"1074ca18-4c48-469d-a37d-db46b91920bc","resolution":{"observed_at":"2026-08-10T18:13:44.385618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-12T22:01:29.230600Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20939","snapshot_observed_at":"2026-08-10T18:13:44.392418Z","title":"Arc-hunyuan-video-7b: Structured video comprehension of real-world shorts.arXiv preprint arXiv:2507.20939, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.392418Z"},"links":{"cited_paper":"/paper/2507.20939","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:ea3755f138b37e169dcdd939f88f9d4f387b84e01f39a8ee58909a7c64fe354f","observation_id":"8aeb4fe0-9bc3-4f5c-9714-ed4492a388df","resolution":{"observed_at":"2026-08-10T18:13:44.392418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.871392Z","title":"Minicpm-o 2.6: A gpt-4o level mllm for vision, speech, and multimodal live stream- ing on your phone.https://github.com/OpenBMB/MiniCPM-V, 2025","venue":null,"work_id":"a456a03f-43a4-4923-bf23-3c5b55275980","year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.399890Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:2db0f2055b6800f5d615217f6ca1974f74f8f8827e1f06bf05fbc84725235356","observation_id":"d59819bb-9364-46b4-a338-0f3746d8b9a2","resolution":{"observed_at":"2026-08-10T18:13:46.876062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-13T04:48:56.237545Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-10T18:13:44.406841Z","title":"Internvl3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.406841Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:15b8edb01e0959d23a1641b3b30f04c3f2abd4e2a954c8e10ac00379405e65b4","observation_id":"dc9de645-8519-4180-9fae-51dfd07e6618","resolution":{"observed_at":"2026-08-10T18:13:44.406841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.414464Z","title":"Self- critical sequence training for image captioning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.414464Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:b3ab9ca553213f1b5943289456a22a2dea53475b4e46ce3a514b6425eaf76302","observation_id":"be280df9-dcdb-4e6d-9846-4a4242ff3b46","resolution":{"observed_at":"2026-08-10T18:13:44.414464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.843379Z","title":"id\": \"sample id","venue":null,"work_id":"538dfaba-5b59-4b32-9f72-48ea3e0bc2b1","year":2002},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.422217Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:76ed9715f4cbe857f58d108ad8a87b1fb6154e6950839fc3f3fea7f77894e100","observation_id":"c49af00d-fb79-4ee8-ac0e-6cd6f366ea28","resolution":{"observed_at":"2026-08-10T18:13:46.848800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.823618Z","title":"Use the exact terminology found in the text (e.g., if the caption says ”shatters”, use ”shatters”, not ”breaks”)","venue":null,"work_id":"92f76c6a-9b5d-4e11-bfd1-0226838c8644","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.429120Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:b0ba8da3178e58ab8a82400829398181f0b2384ff1ccb88a07a6f7f59eb7f0ce","observation_id":"da44a066-d0cc-4715-a367-9fcfba7c58c0","resolution":{"observed_at":"2026-08-10T18:13:46.829527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.803737Z","title":null,"venue":null,"work_id":"13fa5c9f-779b-438c-9e85-2e7968c12e2f","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.441284Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:0bd4f8768b7a338735a70df45b8ab5a5f4d31f3ea84ac0f0cf597bad6d29b4f0","observation_id":"31b2fb4b-b1be-4066-88df-0ed9d35bbe6f","resolution":{"observed_at":"2026-08-10T18:13:46.809850Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.781773Z","title":"Start directly with the answer content","venue":null,"work_id":"9a6af6e3-e6f1-4354-96ec-3dd56b64ce30","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.450979Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:0dccf85a804586c9f6f97f9313fc71cb27572be0ff9326d8970799ea1384e817","observation_id":"06ff5225-4b67-4407-a027-13511abd61a4","resolution":{"observed_at":"2026-08-10T18:13:46.788962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.759415Z","title":"strengths","venue":null,"work_id":"f4f502be-e48f-4d0d-9712-6f93e1a41139","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.457246Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:157e6906ffdef62fb52e46e8e0b27f37518ae7bdae7166b88579d2c84837c717","observation_id":"fa9669e6-ff5d-45ad-bb6c-b38be7b63981","resolution":{"observed_at":"2026-08-10T18:13:46.764825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.734773Z","title":null,"venue":null,"work_id":"dc990cea-1c37-4c57-b9d1-5f3a72a75f4e","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.464484Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:8a0b57d807d7c8f0aba8b76a6ff62bc4654a546f5129448f488159188e190d2c","observation_id":"4a20e370-b5df-4187-8a70-e124cda1f609","resolution":{"observed_at":"2026-08-10T18:13:46.742112Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.711035Z","title":"evaluation","venue":null,"work_id":"8208822b-2397-4d55-88d3-f30d9ae92347","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.473015Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:2b55ac3d175afae87c259d8cbe9c315aed54075309154706cbb20bb5a406347f","observation_id":"bee123fd-afc5-43ed-bb1d-2bd4514bc827","resolution":{"observed_at":"2026-08-10T18:13:46.717454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.686586Z","title":"Do not add any artistic interpretation, subjective analysis, or infer any character’s internal 23 thoughts, emotions, or intentions beyond what is explicitly visible or audible","venue":null,"work_id":"bc837e3a-708b-487f-9b4c-d1c4c71c299a","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.480978Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:f1aa6e56d12754aec5340767c7b7298a07aa1b1aa4b8b70a203284371b91de47","observation_id":"6f54366b-2833-4bff-a4bb-38ad54d5fcc9","resolution":{"observed_at":"2026-08-10T18:13:46.692726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.661477Z","title":"While Character A is speaking, Character B simultaneously turns their head","venue":null,"work_id":"53797932-1434-4e3e-9b03-d977f1312781","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.486950Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:b6a8b6f5744e245e720a56e7a9808616611ee5a9728ee3f81541ba65cf6d306c","observation_id":"90a1999f-d774-4123-a162-e1bbae85ba49","resolution":{"observed_at":"2026-08-10T18:13:46.668462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.642292Z","title":"He closed the door,","venue":null,"work_id":"60404918-509a-4bd7-b34b-619b4f3094d1","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.494599Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:daff8a2b2b9b8a01f3f013ba4eddba3fed855b08d0566c9c5b49ca9028b06283","observation_id":"36b615f7-5d65-48b6-b411-84544350326a","resolution":{"observed_at":"2026-08-10T18:13:46.648814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.622577Z","title":"The camera cuts to a close-up of her face,","venue":null,"work_id":"851b6641-378b-48e6-850a-866e213edf35","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.502462Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:b1a13d5d7b7a99a7406e7d62126ee81ff763b56164228861051b83d1cfb3c43f","observation_id":"a39cd8a8-82c3-4890-ab62-d46deb18892b","resolution":{"observed_at":"2026-08-10T18:13:46.628650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.598173Z","title":null,"venue":null,"work_id":"8a99c806-ad8d-46de-a262-d084532a91bd","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.516642Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:6c28f9076fea57da038f7ae7d700f3f105ec8882c77303a18f8dea1feca81c56","observation_id":"52b76ef2-21c0-4633-a1fe-87058085ec5f","resolution":{"observed_at":"2026-08-10T18:13:46.608847Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.569355Z","title":"Do not use bullet points, headings, or line breaks within the narrative","venue":null,"work_id":"dd77729d-0b13-4cba-a68a-0f29ca9915eb","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.523799Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:ff54d3478e70ac6c7716a03a90a4eef16dcf2627ce2f75627e5ce768ac056522","observation_id":"e8eebfdd-7bb2-4176-9ed5-f3a690bb0f80","resolution":{"observed_at":"2026-08-10T18:13:46.577670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.543177Z","title":"His voice, thick with sarcasm, says","venue":null,"work_id":"1cada282-7a2f-4b04-94a8-cf169ba6085f","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.531066Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:868e8e9d11d2f3a533610d3e8f196b9e7d1c0080a0f85eb5b00dfd6c74baacfe","observation_id":"70b54954-8d96-4140-823a-14fdffbda128","resolution":{"observed_at":"2026-08-10T18:13:46.553912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.519979Z","title":"thud\" as a book hits the table, a","venue":null,"work_id":"c1698fd2-3ad9-4a6f-b550-81f44fc37a82","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.543586Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:fff6c570083f7d8ac654512c357f265f59d956bdd7b8d1d5e4ce1bc2d6f7a30a","observation_id":"90c315f3-909b-46c3-93ad-2d8bb8a5336c","resolution":{"observed_at":"2026-08-10T18:13:46.526057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.492091Z","title":"While Person A’s hand reaches for the glass, Person B’s eyes dart to the side, and the music swells","venue":null,"work_id":"91bff0e1-014a-48dc-841e-b15435c1d979","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.557179Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:f41f3d1450dfda88f8f3997fc713138b28f9fdd041166af82d78cddad7ac3056","observation_id":"64b2eb73-aa40-48d3-8df0-360d4fdca671","resolution":{"observed_at":"2026-08-10T18:13:46.499941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.462208Z","title":"Avoid summarizing","venue":null,"work_id":"59dc0b1f-154a-4613-a672-6652fdca6d94","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.563308Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:39dd892dacfbef5511872b568aa5f04e8aa705ed72a79f2c4fdb7d8671ee8800","observation_id":"0092d044-e526-435f-8cb0-7f3df378f2fb","resolution":{"observed_at":"2026-08-10T18:13:46.471133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.437947Z","title":"strengths","venue":null,"work_id":"f8983525-1da8-4260-bd56-a7d81878f60c","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.573450Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:3ce55b339b45de0431d85268d64a6257f2ecfb7d258c4b896ffeb986dd082086","observation_id":"8457dc9e-0c4b-4dcb-8fe2-d16d504a83a2","resolution":{"observed_at":"2026-08-10T18:13:46.445294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-08-12T16:10:35.170069Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04326","snapshot_observed_at":"2026-08-10T18:13:44.362349Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.362349Z"},"links":{"cited_paper":"/paper/2502.04326","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:61d647be2f2f79c425ca98085477b306881ea12d296b2673a551794459d7da04","observation_id":"271c8407-3349-4ac9-8db6-390573dd5ff2","resolution":{"observed_at":"2026-08-10T18:13:44.362349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T13:11:54.591783Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":2,"verified_fuzzy":26},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 0 inbound Pith citation observations for arXiv:2608.06930."}