{"as_of":"2026-08-10T05:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:726a02969bdf3f24168136ff698a8bacec81454f30414ed0a81d69a5a7c2d4fd","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:53:21.073886Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T01:05:26.926438Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-08T01:05:27.182138Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-09T05:08:35.154237Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":"2507.01492","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01492","snapshot_observed_at":"2026-08-08T01:05:27.182138Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","venue":"cs.CV","work_id":"8b7b8e80-6767-498e-a92d-a3fc0720a761","year":2025},"citing_paper":{"arxiv_id":"2608.03046","last_updated":"2026-08-04T02:55:10Z","snapshot_observed_at":"2026-08-10T02:44:15.194452Z","submitted_at":"2026-08-04T02:55:10Z","title":"CAPE-T2V: Captioner-Anchored Prompt Enhancement toward Two-Sided Conditioning Alignment in Text-to-Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T01:05:26.926438Z"},"links":{"cited_paper":"/paper/2507.01492","citing_paper":"/paper/2608.03046"},"observation_digest":"sha256:580fb8d186f23e4e72c54ec9916f5e2ed045195210642abf38dd5a58d44e785d","observation_id":"4d026c89-1521-4c95-a135-b6cd914c956b","resolution":{"observed_at":"2026-08-08T01:05:27.188251Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.01492/citation-record","integrity":"/paper/2507.01492/integrity","json":"/paper/2507.01492/citation-record.json","paper":"/paper/2507.01492"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T20:53:19.709202Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-09T05:08:35.154237Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:19.709202Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:965520759309f44b571b2aa9ee6a5aa99156437322a19209e1dfebcae3b318d0","observation_id":"9fe64d67-b6fd-4161-9c67-9f5f0b0eb188","resolution":{"observed_at":"2026-08-06T20:53:19.709202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-08-06T20:53:19.764060Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-09T05:08:35.154237Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:19.764060Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:9c89726d52bacfd437872d251476d6cc6397396305b9977b38f09f9c339fe1d5","observation_id":"2e94a8c9-1420-4ad4-97ce-400db8aba0f9","resolution":{"observed_at":"2026-08-06T20:53:19.764060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:22.320053Z","title":"Personal- 4 ized video summarization by multimodal video understand- ing","venue":null,"work_id":"7f087580-6be6-40e2-a838-fc70fa906933","year":2024},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-09T05:08:35.154237Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:19.833575Z"},"links":{"citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:54a653c591b4866c0651edd4e3243ad54ef6e201772c6071574c05cc493c25f7","observation_id":"c4068880-fffb-454c-9764-ff3ea91bdf1b","resolution":{"observed_at":"2026-08-06T20:53:22.379581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:22.164058Z","title":"Sharegpt4video: Improving video understanding and generation with better captions, 2024","venue":null,"work_id":"d3359f1d-c322-4df0-b4e0-6a313ad36941","year":2024},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-09T05:08:35.154237Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:19.908823Z"},"links":{"citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:3a2786e892d76f6efff7820317c971c0c83c9e89ed247a2ba440f494c80a26ea","observation_id":"740fe1f0-4bfb-4316-960a-00379e54b628","resolution":{"observed_at":"2026-08-06T20:53:22.208046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:19.971746Z","title":"Versavid-r1: A versatile video understanding and reasoning model from question answering to captioning tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-09T05:08:35.154237Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:19.971746Z"},"links":{"citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:da960ad3f898d77320b4613b9ecada04b6116b45ba3b176dd703f3d2c45d382f","observation_id":"8f8b76c6-569e-4441-a756-8921c0ef814e","resolution":{"observed_at":"2026-08-06T20:53:19.971746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00318","last_updated":"2026-04-04T04:38:43Z","snapshot_observed_at":"2026-07-06T21:34:05.672636Z","submitted_at":"2025-05-31T00:08:21Z","title":"Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00318","snapshot_observed_at":"2026-08-06T20:53:20.012906Z","title":"Chain-of-frames: Advancing video understanding in multimodal llms via frame-aware reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-09T05:08:35.154237Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.012906Z"},"links":{"cited_paper":"/paper/2506.00318","citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:037d23fa2e368abd6806cd86acaee8960235bea5c45f896276415cea096632f0","observation_id":"42df691b-53f9-4751-a864-fee302343cbc","resolution":{"observed_at":"2026-08-06T20:53:20.012906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T20:53:20.062315Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-09T05:08:35.154237Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.062315Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:1ac7b0b7a0c57fdee2083e1d290d4065f17f51d4a10c4004e1ba700105d36093","observation_id":"81842245-3584-42af-815f-d44d8e3626c9","resolution":{"observed_at":"2026-08-06T20:53:20.062315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-08-06T20:53:20.138597Z","title":"Videochat- flash: Hierarchical compression for long-context video mod- eling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-09T05:08:35.154237Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.138597Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:a9a392c2596bc228a9325f7e05960aae7e775692d75a5015e881346025011b3a","observation_id":"632099fc-9a4c-47e4-b513-325dddaaf3e7","resolution":{"observed_at":"2026-08-06T20:53:20.138597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16072","last_updated":"2025-04-22T17:51:41Z","snapshot_observed_at":"2026-08-07T16:00:09.944765Z","submitted_at":"2025-04-22T17:51:41Z","title":"Describe Anything: Detailed Localized Image and Video Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16072","snapshot_observed_at":"2026-08-06T20:53:20.191292Z","title":"Describe anything: Detailed localized image and video captioning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-09T05:08:35.154237Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.191292Z"},"links":{"cited_paper":"/paper/2504.16072","citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:6a6ffceecaedd16995dbf1d9912f183ebd7613482fedc00a640e7f885f728b96","observation_id":"5e285e60-b5a0-4e43-b69b-06dd47471ff1","resolution":{"observed_at":"2026-08-06T20:53:20.191292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:20.256177Z","title":"Inference-time scaling for generalist reward modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-09T05:08:35.154237Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.256177Z"},"links":{"citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:7fe81cb426a2a96d73b6a178b345fc0bc6fd13b51d87004e93046856cb95894d","observation_id":"aa56aee0-a092-4d00-bf56-8ac3e8d230f4","resolution":{"observed_at":"2026-08-06T20:53:20.256177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:21.995170Z","title":"Videocap-r1: Enhancing mllms for video captioning via structured thinking, 2025","venue":null,"work_id":"6aa238cb-122f-412d-b02e-052fba4999d5","year":2025},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-09T05:08:35.154237Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.295026Z"},"links":{"citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:7a0ab2ca40b6ef2da5ef58bdc356358ec3f44656a7384a9fa3608a748df2d640","observation_id":"5a27968d-73f0-4706-a707-88aff6f7073a","resolution":{"observed_at":"2026-08-06T20:53:22.081458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18152","last_updated":"2025-04-25T08:05:32Z","snapshot_observed_at":"2026-08-07T15:59:17.660418Z","submitted_at":"2025-04-25T08:05:32Z","title":"ActionArt: Advancing Multimodal Large Models for Fine-Grained Human-Centric Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18152","snapshot_observed_at":"2026-08-06T20:53:20.338147Z","title":"Ac- tionart: Advancing multimodal large models for fine- grained human-centric video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-09T05:08:35.154237Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.338147Z"},"links":{"cited_paper":"/paper/2504.18152","citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:b7dcfa316d7f665cbb0fa4b27415d88d134424f219fded25e12a0df2f628b94c","observation_id":"25fe8ebe-aa16-489f-aea8-7827e1cd60b3","resolution":{"observed_at":"2026-08-06T20:53:20.338147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:21.824807Z","title":"Cockatiel: Ensembling synthetic and hu- man preferenced training for detailed video caption, 2025","venue":null,"work_id":"31f33147-26b2-4f98-bcb8-15d1259c96e6","year":2025},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-09T05:08:35.154237Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.381184Z"},"links":{"citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:26be2390759ccda6670a7e8cf47c055b5039cd93fb32ee51c2a07a0eff40a3ab","observation_id":"8a90b50f-be42-4b50-b8ce-caff318d76b8","resolution":{"observed_at":"2026-08-06T20:53:21.865289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:21.721819Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"290bebd2-bff6-49d3-8d8d-162b9153ecf2","year":2023},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-09T05:08:35.154237Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.441583Z"},"links":{"citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:9f30029c0651c2f3ea354711863df1c4a6291e83d83b988fcede7e0c467faa55","observation_id":"9db24de2-15f7-4aee-a32a-5d542f5de9c8","resolution":{"observed_at":"2026-08-06T20:53:21.766181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05541","last_updated":"2025-04-09T02:30:44Z","snapshot_observed_at":"2026-08-07T16:07:46.494762Z","submitted_at":"2025-04-07T22:35:36Z","title":"Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05541","snapshot_observed_at":"2026-08-06T20:53:20.489681Z","title":"Caption anything in video: Fine- grained object-centric captioning via spatiotemporal multi- modal prompting","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-09T05:08:35.154237Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.489681Z"},"links":{"cited_paper":"/paper/2504.05541","citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:3adb42198fe7cdc93680c099178a665dcdbf6406c774cee74d63a7c6064afde4","observation_id":"e7e616bd-45a4-4437-83a7-612507711469","resolution":{"observed_at":"2026-08-06T20:53:20.489681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T20:53:20.539317Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-09T05:08:35.154237Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.539317Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:5689e0c6260eb4b4bb3392c144b8ad008616dcd7fc92c2a326b13651307a17ec","observation_id":"0daa0044-fe45-4da8-873d-8fa6a4394704","resolution":{"observed_at":"2026-08-06T20:53:20.539317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:21.624133Z","title":"Progress-aware video frame captioning","venue":null,"work_id":"c03c8929-0ec4-469f-b96f-dc42e8122bbd","year":2025},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-09T05:08:35.154237Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.617223Z"},"links":{"citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:b637f04d2284a72f1c53706dbc6e27257090ab5144222f09307dbe72c51baaf6","observation_id":"467c9247-8a1a-4fd7-953e-12fe389bb211","resolution":{"observed_at":"2026-08-06T20:53:21.674173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-09T05:32:01.732887Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23484","snapshot_observed_at":"2026-08-06T20:53:20.756229Z","title":"Vcapsbench: A large-scale fine-grained benchmark for video caption quality evaluation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-09T05:08:35.154237Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.756229Z"},"links":{"cited_paper":"/paper/2505.23484","citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:933dcd07f0754306fd0623b312a51df301b2ed2f36e97b101a60927fd2460caa","observation_id":"b44abbe4-452e-4abe-804d-ad4bb0f2d803","resolution":{"observed_at":"2026-08-06T20:53:20.756229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-06T20:53:21.033536Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-09T05:08:35.154237Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:21.033536Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:22c209464d47f02672c96da6d383b73ed4cfeafe5cc693b77b1043ce70a28953","observation_id":"9d1e3cba-0d00-4e50-a1e7-d1699e39c8d3","resolution":{"observed_at":"2026-08-06T20:53:21.033536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:21.482878Z","title":"Llamafac- tory: Unified efficient fine-tuning of 100+ language mod- els","venue":null,"work_id":"407a4fd0-b91d-4941-9767-99414bbb2e97","year":2024},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-09T05:08:35.154237Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:21.073886Z"},"links":{"citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:5a8e995b007eca51c814ddf83d8740d15cd2ec810dc242caadb61b9c9ee56974","observation_id":"f140f3be-3eb9-4c52-a2d4-ff48d67292d1","resolution":{"observed_at":"2026-08-06T20:53:21.559531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T05:08:35.154237Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 1 inbound Pith citation observation for arXiv:2507.01492."}