{"as_of":"2026-08-09T19:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6734ba627698bf20516f0ed4a99651a2a3de95bc95435a9c1accf43a46dd7f9f","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:36:29.862040Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T04:35:39.356919Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T04:39:35.268570Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"cited_work":{"arxiv_id":"2507.18531","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.18531","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Intentvcnet: Bridging spatio-temporal gaps for intention- oriented controllable video captioning","venue":null,"work_id":"4c20facf-00b3-4eb2-8244-05275c135f39","year":2025},"citing_paper":{"arxiv_id":"2605.21411","last_updated":"2026-05-20T17:08:18Z","snapshot_observed_at":"2026-08-01T18:43:45.428590Z","submitted_at":"2026-05-20T17:08:18Z","title":"RoadTones: Tone Controllable Text Generation from Road Event Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T04:35:39.356919Z"},"links":{"cited_paper":"/paper/2507.18531","citing_paper":"/paper/2605.21411"},"observation_digest":"sha256:1744b69305346363336bcff6a87ba51f83256e4dd22c5aa91051269733003a2f","observation_id":"dc631b3f-aa4e-4c98-9e70-26fcb13e0df4","resolution":{"observed_at":"2026-05-21T04:39:35.270214Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.18531/citation-record","integrity":"/paper/2507.18531/integrity","json":"/paper/2507.18531/citation-record.json","paper":"/paper/2507.18531"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T14:36:28.756643Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.756643Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:8f5ab887ea530a87c960cd6b3613d1ac7112731430a05e4cf815b327ca729ca2","observation_id":"dc6a7e31-8201-4180-ba38-9dafbbc109b2","resolution":{"observed_at":"2026-08-06T14:36:28.756643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:28.774002Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.774002Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:5c2653e77c2241f6fc2560f5e301b10fab91df391f0dd5d8977153b658bca6d4","observation_id":"42204628-102c-42c1-b5f6-45ebfafbd812","resolution":{"observed_at":"2026-08-06T14:36:28.774002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:33.625974Z","title":null,"venue":null,"work_id":"e96b422b-19cf-494a-b326-d52f8139f0a5","year":2025},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.804732Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:5dcca83c746327d61ead67eafd8c6dde9e613632d870310e6fafd546e48e8308","observation_id":"2f414133-f829-442a-b0ed-51acb9ff197f","resolution":{"observed_at":"2026-08-06T14:36:33.630954Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-08-06T14:36:28.824818Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.824818Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:8a33915d2b9d4df30468e9e67039079975386eae4abcec53bfc76e3faf4ab82b","observation_id":"bbb85bc4-a452-4b8e-8689-a4428efd383a","resolution":{"observed_at":"2026-08-06T14:36:28.824818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:28.830571Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.830571Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:d0ad891544169892567a508b4484afe8a501c8ce195f97243ab00537c0a35988","observation_id":"13215b2a-2602-4f18-bf25-eeb3a07d5c9b","resolution":{"observed_at":"2026-08-06T14:36:28.830571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:33.592959Z","title":null,"venue":null,"work_id":"f1664d64-d03a-4223-9b10-a3d8b110ec0d","year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.862647Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:642ebfa195bbd04a24c920e3af70b2c89e43c28a96fca579b1782d001ec05584","observation_id":"731f6ea5-715e-42e1-b475-8aae446a1e72","resolution":{"observed_at":"2026-08-06T14:36:33.598539Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:33.554738Z","title":null,"venue":null,"work_id":"a4982b51-ca74-4342-b825-d821e0c9ab05","year":2017},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.870648Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:6cf5af8aeeb17804d0367a49572e53a311bbf729903628ed2f4fd8d42863d24b","observation_id":"a16528c4-38d0-4fba-ac9f-3c2da59e467c","resolution":{"observed_at":"2026-08-06T14:36:33.567933Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T14:36:28.875907Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.875907Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:4749bb2a4c54baacf30d8eefc564cf4671205ff898cb05341f36d6232f4e8930","observation_id":"0c156231-190f-4f73-82ca-c18507dc9569","resolution":{"observed_at":"2026-08-06T14:36:28.875907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:33.512690Z","title":null,"venue":null,"work_id":"f4f9b571-5e77-4881-bad2-865277c18ce4","year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.884001Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:e49a17a9bdf9b169abb6cf7d7ae8bde3884949db1e4e88e77db699c4cc482130","observation_id":"4ad8fe91-e6ad-465f-808c-5951059f9066","resolution":{"observed_at":"2026-08-06T14:36:33.519400Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T14:36:28.890640Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.890640Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:92339054ed2463f3179f91715fece4ec730e9797ca2c79182d4184762d9bb9ba","observation_id":"76d80ee7-7cae-45e7-a7ff-4b17429fda7c","resolution":{"observed_at":"2026-08-06T14:36:28.890640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:33.478396Z","title":null,"venue":null,"work_id":"1e0d0098-4f92-4a6c-9be3-fea6cab7e97e","year":2019},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.896730Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:e489a91126eb175ee1cdd83ef8fa4e07142fcdf838937f360468ac682dd5ea5a","observation_id":"0523fc10-059e-42a5-8757-946baf492dc1","resolution":{"observed_at":"2026-08-06T14:36:33.484662Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:28.902907Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.902907Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:efb7d8224fcd110a4c6b68f8777af008a756a57b90a14970c19f6b370d9a4d1c","observation_id":"5abe577e-90ef-4cc7-bd88-a015cf6a7550","resolution":{"observed_at":"2026-08-06T14:36:28.902907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:28.911252Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.911252Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:02c5f20d4d10aa12493fabaa9731ad3bbd28f64ab88119386815f5963754aeb3","observation_id":"308f1e94-137a-42e2-afa2-859c0e6185df","resolution":{"observed_at":"2026-08-06T14:36:28.911252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:33.399009Z","title":"Kastner, Yasutomo Kawanishi, Trung Thanh Nguyen, and Junan Chen","venue":null,"work_id":"79a65014-de57-4130-a2e9-379e8cdbe644","year":2025},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.918071Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:bd5e81f0c4afab38d2cc09c65ccb561b42133a892f2ce36d343e81d224aca378","observation_id":"30c5393b-afda-49a0-8f06-22ab38060af6","resolution":{"observed_at":"2026-08-06T14:36:33.409054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:28.935806Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.935806Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:8110471985e1cb26fa59b947eb27144704d8b18d0a2408f4406e3e34827a6a43","observation_id":"b4dad6c9-5a3b-4527-bb40-5c391699ec5b","resolution":{"observed_at":"2026-08-06T14:36:28.935806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:33.242255Z","title":null,"venue":null,"work_id":"9e283232-8530-47d7-a3b5-1f649c7212ac","year":2017},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.950400Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:e61bb6bf11567e9aeac98fc1240c212dd46533e42bf1876405a542a2be60c208","observation_id":"dfe291c8-0c5b-44b1-a2eb-1298ca80235e","resolution":{"observed_at":"2026-08-06T14:36:33.330172Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:33.043988Z","title":null,"venue":null,"work_id":"7c9b86a4-3a3f-4802-af1f-838bbe129aa8","year":2021},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.957212Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:ffac4668273f26dbc61184732f47bceecbeade952dcb3df431e0814a30e142c5","observation_id":"93078549-2e74-4600-8872-1a6b7649fb2a","resolution":{"observed_at":"2026-08-06T14:36:33.136958Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18385","last_updated":"2024-02-28T15:05:43Z","snapshot_observed_at":"2026-07-06T17:36:52.920342Z","submitted_at":"2024-02-28T15:05:43Z","title":"The First Place Solution of WSDM Cup 2024: Leveraging Large Language Models for Conversational Multi-Doc QA","version":1},"cited_work":{"arxiv_id":"2402.18385","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.18385","snapshot_observed_at":"2026-08-06T14:36:30.671870Z","title":"The First Place Solution of WSDM Cup 2024: Leveraging Large Language Models for Conversational Multi-Doc QA","venue":"cs.CL","work_id":"1db82f90-6477-464b-8081-01e713b5b3cc","year":2024},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.963157Z"},"links":{"cited_paper":"/paper/2402.18385","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:d19638d373f2f62c0706f1764ff9599d02aef972c8bf5fb5e54b7235fbf6ca0a","observation_id":"288323a4-0bae-499f-a36d-8327cb51eeba","resolution":{"observed_at":"2026-08-06T14:36:30.683604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06071","last_updated":"2024-03-05T14:36:12Z","snapshot_observed_at":"2026-07-30T19:32:30.807724Z","submitted_at":"2024-01-11T17:41:57Z","title":"GroundingGPT:Language Enhanced Multi-modal Grounding Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06071","snapshot_observed_at":"2026-08-06T14:36:28.980544Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.980544Z"},"links":{"cited_paper":"/paper/2401.06071","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:b99026cce235b47006b84c48e6b6a327d56c37364f47c235b4dd91c9286fd515","observation_id":"6149dfaf-44e7-4ebe-91ac-a649344baf6b","resolution":{"observed_at":"2026-08-06T14:36:28.980544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-06T14:36:28.987835Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.987835Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:49430ac1e6bba154a2cab3501a97a1739e80ec0fa24923e3aa717e2e66998f51","observation_id":"6e131865-637e-4ff8-b0d5-85303bf7a887","resolution":{"observed_at":"2026-08-06T14:36:28.987835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:32.859609Z","title":null,"venue":null,"work_id":"823580b6-86e8-432b-b7c1-8c52f0f9ac6f","year":2022},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.038967Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:03da95969c0a6d7e0779c2e25410ca5ad053a64860477a25a01d9121f7b4a929","observation_id":"8577305e-dd05-4d2f-afa0-f5367d9c21b6","resolution":{"observed_at":"2026-08-06T14:36:32.907929Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:29.074740Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.074740Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:6a0bb85d959dbcd02b0a2808fefb4bcf99465841f5b1b69503ae8a3018eae496","observation_id":"0bd1384c-21e0-418e-a515-4dca5363be3d","resolution":{"observed_at":"2026-08-06T14:36:29.074740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-06T14:36:29.101479Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.101479Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:7e0340127550fa67c0af6444215516289a727f37b1ee3ddecbd990bf8584f166","observation_id":"9a5d55e2-8499-4997-8b8f-7e832017e2e5","resolution":{"observed_at":"2026-08-06T14:36:29.101479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:29.124744Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.124744Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:e2adbdfe5903efdd569d1a0ae7449ba53e81301213777463dda93f9396322672","observation_id":"cfb91417-6894-4509-bd7d-a56b5435c770","resolution":{"observed_at":"2026-08-06T14:36:29.124744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:29.149139Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.149139Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:446c67dc4941f8afd2494c5e67895ecfaca689686d516ed399994d750ab84802","observation_id":"ae3ba893-d498-469e-b526-bc5454769ffc","resolution":{"observed_at":"2026-08-06T14:36:29.149139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.02300","last_updated":"2017-08-07T20:50:24Z","snapshot_observed_at":"2026-08-02T01:44:42.585261Z","submitted_at":"2017-08-07T20:50:24Z","title":"Reinforced Video Captioning with Entailment Rewards","version":1},"cited_work":{"arxiv_id":"1708.02300","doi":null,"metadata_source":"pith","pith_arxiv_id":"1708.02300","snapshot_observed_at":"2026-08-06T14:36:30.533636Z","title":"Reinforced Video Captioning with Entailment Rewards","venue":"cs.CL","work_id":"a2c5247b-9ab5-48e4-894b-926e2416b5ac","year":2017},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.160509Z"},"links":{"cited_paper":"/paper/1708.02300","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:b41d4acceb880ea4e8ec859595110257600de71d4fdd458f164b989afc2babea","observation_id":"5e52972a-9ce2-4cb0-94fb-a9ebb190d69b","resolution":{"observed_at":"2026-08-06T14:36:30.540454Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-06T14:36:29.179246Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.179246Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:c65bd487ca2ffa35040fdd8f328b33606ae126480e5c16f477e95f19917132bd","observation_id":"bac88a13-b8bd-4d48-a736-82ca1ff6b729","resolution":{"observed_at":"2026-08-06T14:36:29.179246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:32.583886Z","title":null,"venue":null,"work_id":"ad0ef2b7-2087-43b9-af05-684149ab40d2","year":2004},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.204885Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:d9dd464edb38ce21609b57c5004c39651d43e791b62dcf49356d153629096652","observation_id":"0481b339-1842-4dcd-a94c-bd18a6cd7b7a","resolution":{"observed_at":"2026-08-06T14:36:32.645965Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06720","last_updated":"2023-12-13T04:45:01Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T02:50:46Z","title":"Audio-Visual LLM for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06720","snapshot_observed_at":"2026-08-06T14:36:29.216841Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.216841Z"},"links":{"cited_paper":"/paper/2312.06720","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:f3aec34b20b9a6cc93ea5d72528baf9edcaab3a6d3d6aa0d410beff7dad3d606","observation_id":"bc1ed0eb-b562-42ae-a323-31a5a96752f1","resolution":{"observed_at":"2026-08-06T14:36:29.216841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:29.236144Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.236144Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:33f36badc711c2d5e9ecb8f6d70c34b4cacfb4e78fc835e257324a389ca3c192","observation_id":"f0a0e0de-24b5-4f19-a70d-d297d9ff9c47","resolution":{"observed_at":"2026-08-06T14:36:29.236144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:29.279165Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.279165Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:4f5e4d90e6c031d65634b0ea98c94dc88bba86febceecaff74c31772bee00f2a","observation_id":"4374199a-da92-4eb0-95ac-ec8cef97716d","resolution":{"observed_at":"2026-08-06T14:36:29.279165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:29.296001Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.296001Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:e6382e2b280868233a699f93b23da2bf7135c8b47d21c9b8d8f7ce812fd5468a","observation_id":"3dc758d5-3d19-4cd6-847a-be6cc3d62e1e","resolution":{"observed_at":"2026-08-06T14:36:29.296001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:29.332967Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.332967Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:56b47e5db505574371641df10e5e2e2cb3539e0782225b35f5048398745a89f2","observation_id":"07d0839b-d37b-44fd-9e28-5f60c3c7f7dd","resolution":{"observed_at":"2026-08-06T14:36:29.332967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:29.326969Z","title":"In Proceedings of the 31st ACM International Conference on Multimedia","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.326969Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:0f700c4ec3b8f91825eb521f372309b78f98503674c56b66cea425aabe4d54b1","observation_id":"06e59a2a-f5cb-47b1-8749-73b6fb7f2721","resolution":{"observed_at":"2026-08-06T14:36:29.326969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05541","last_updated":"2025-04-09T02:30:44Z","snapshot_observed_at":"2026-08-07T16:07:46.494762Z","submitted_at":"2025-04-07T22:35:36Z","title":"Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05541","snapshot_observed_at":"2026-08-06T14:36:29.394779Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.394779Z"},"links":{"cited_paper":"/paper/2504.05541","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:1622238aa724befcefd8af782a45c7433352c12929e2d15a4f60e837df33850c","observation_id":"ad3ad4e7-b1ae-4c7d-b6bc-9f6e5a73b46a","resolution":{"observed_at":"2026-08-06T14:36:29.394779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:29.447467Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.447467Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:67a7c4528022dc11b1ca0397051ac83e53b6b25e2d80ce7100f7a958f7d512c3","observation_id":"095751ea-1c5c-419e-8643-040b6bf1c3d9","resolution":{"observed_at":"2026-08-06T14:36:29.447467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:31.917024Z","title":null,"venue":null,"work_id":"9361b717-fbd7-4e33-929a-3e9915180c6c","year":2024},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.365989Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:aba6b228fd539b299272b648f10ac3ecba01181968032798ce634932d5e2f4f0","observation_id":"319a4095-870c-416d-a64c-ca4636aa7a69","resolution":{"observed_at":"2026-08-06T14:36:32.040258Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:31.624489Z","title":null,"venue":null,"work_id":"6d44ee86-25e3-40e3-8ce6-9e26fbf886e3","year":2019},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.491095Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:7d7148eeb1882e13fa0c8380951af270200d92d0e6ea56c143a6d0f0dcd61695","observation_id":"31188037-4dab-4cc2-ad2d-635ee4f64788","resolution":{"observed_at":"2026-08-06T14:36:31.694759Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:31.524741Z","title":null,"venue":null,"work_id":"f313113c-5bec-4693-881c-c63ac0f565ee","year":2024},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.499869Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:1382e33873c100902ffb812a0e5960c810acff1f6b668a30cfe08a31d3eabc4d","observation_id":"f38be541-5772-4fe8-9f6b-4b15eb7bf32b","resolution":{"observed_at":"2026-08-06T14:36:31.549968Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:29.474796Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.474796Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:b168dfeb16a7bcf911733e05ba63fbd02df29d9f5812a71cb3cc2e82cfce3d3d","observation_id":"19b5d2ad-b7c1-4368-8a6c-07d279cc7f99","resolution":{"observed_at":"2026-08-06T14:36:29.474796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:31.130137Z","title":null,"venue":null,"work_id":"800cd703-4319-4944-8645-74177b46e108","year":2024},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.532008Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:893bff65a90de015f364865abd9c35043e87b962af49e22e985dad013d6fd6e6","observation_id":"c973e061-80aa-4b03-9b71-d641c42539c6","resolution":{"observed_at":"2026-08-06T14:36:31.138936Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-06T14:36:29.583224Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.583224Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:0c5225ad47ec1f00abed70a7781db00e6fbea3760acd473bb8d09d25a299f346","observation_id":"9e461aa4-bd38-4e8b-a4bb-e5313aa4cb95","resolution":{"observed_at":"2026-08-06T14:36:29.583224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:31.427880Z","title":null,"venue":null,"work_id":"06b068ea-f0d4-43ee-9c42-38d352b5bac2","year":null},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.509421Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:0e6c49c7b8aeae98057d0ea0bcd24441c2c7e89f09db61377d2e7956f11bfe78","observation_id":"c9b73b3b-3978-44c9-8fe7-ea8da1860696","resolution":{"observed_at":"2026-08-06T14:36:31.450436Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:31.023599Z","title":null,"venue":null,"work_id":"8965b1e2-c35f-4d58-a7a7-ffef06445de5","year":2024},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.654739Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:eb3f58abb5a1e8e234e7d7cc5a99806b9bc51695a06006b31ce46d2629f60853","observation_id":"c5cf68d7-08d0-45c3-9875-4330fd4e649a","resolution":{"observed_at":"2026-08-06T14:36:31.038003Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-08T03:13:28.000968Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-06T14:36:29.673490Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.673490Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:cac34d147e289208e5e889e5d5ae88b8770c448e302df2198cd80adbeb5a5c7a","observation_id":"53ec807f-a90b-4c6d-a069-f22338da95a8","resolution":{"observed_at":"2026-08-06T14:36:29.673490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06430","last_updated":"2023-03-02T08:24:23Z","snapshot_observed_at":"2026-08-07T22:11:50.819752Z","submitted_at":"2022-09-14T05:47:02Z","title":"CLIP-ViP: Adapting Pre-trained Image-Text Model to Video-Language Representation Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06430","snapshot_observed_at":"2026-08-06T14:36:29.684895Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.684895Z"},"links":{"cited_paper":"/paper/2209.06430","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:6645822b59cf35559de022b71a644fd68d37f0efb056956ff48ccfd6bda97cb5","observation_id":"68df01c5-db36-4869-a1ba-cc133ae62b8f","resolution":{"observed_at":"2026-08-06T14:36:29.684895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:31.098105Z","title":null,"venue":null,"work_id":"53482b7b-9b34-4d43-90aa-7cb2bfe2e70b","year":null},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.607606Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:01cfd28c6c18678cc82451d99b072185fc621580a244a5d3e040720a844b8199","observation_id":"5835d953-a9c2-44f1-84de-92bb33d1d9e7","resolution":{"observed_at":"2026-08-06T14:36:31.110929Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:29.709137Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.709137Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:4e013104fe6bef70b6d9f55a7c0590a485569681f8dbb6a0be4cc49d27c0d705","observation_id":"d7067fad-f68f-460a-a4fe-d845ebd89253","resolution":{"observed_at":"2026-08-06T14:36:29.709137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:30.971689Z","title":null,"venue":null,"work_id":"f8193561-7259-41f4-962c-37072df3503d","year":2024},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.726957Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:ba9527ba439e253f1966685e8b2c6d35c345ddced79cff7643c038f13a1ed459","observation_id":"31dcf7d2-1e4f-48d5-88ad-189e61538283","resolution":{"observed_at":"2026-08-06T14:36:30.976741Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:30.925480Z","title":null,"venue":null,"work_id":"0fa1e0e9-702f-4333-bc43-71bbb2d21d03","year":2024},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.741989Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:6084bb1ad5212b650b8ef7897833756f3e281bbec8528f60a70d9fb94ccfc41d","observation_id":"29c554df-1207-4a9c-80f4-2f8247fbcc36","resolution":{"observed_at":"2026-08-06T14:36:30.946168Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:30.900656Z","title":null,"venue":null,"work_id":"5ba2322f-9b5a-46ae-b505-cbf5cfa44505","year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.748938Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:1d081de6a64fd14ae2d1730fd2b8c9e0581dd450062251f1dd8f2fbeae4cfc11","observation_id":"03d931d2-76c4-40a9-b6b1-26f88676df9e","resolution":{"observed_at":"2026-08-06T14:36:30.906135Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T14:36:29.695562Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.695562Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:555e9ee8a033e563cab98ba1259f8c1335687f3e45e2afb26466e86a2c6ec0f2","observation_id":"a70c7932-59e7-4ac5-a0af-b4d76ac58e99","resolution":{"observed_at":"2026-08-06T14:36:29.695562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-06T14:36:29.767987Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.767987Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:f5337387d882975bd15282c6e2ca776511b90f095997bf9c41d3af1aa4fc5b7c","observation_id":"fcf9863a-fb78-41c6-92da-21c52c478f7c","resolution":{"observed_at":"2026-08-06T14:36:29.767987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-06T14:36:29.714217Z","title":"arXiv preprint arXiv:2310.11441 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.714217Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:1d1e8ef37d47a0cbc5ef3abd5ee27a5f07d0c3c3f08848ac0fe4715e2dd765ef","observation_id":"be0ef333-e251-4713-8cf3-b698da8e4b71","resolution":{"observed_at":"2026-08-06T14:36:29.714217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:29.787485Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.787485Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:1ca479d1ebd11df371791969215d31e52c9255397d21d03f172dcf2e3b64901e","observation_id":"918efbcc-c026-423b-8c60-ec56077fd46b","resolution":{"observed_at":"2026-08-06T14:36:29.787485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:30.820478Z","title":null,"venue":null,"work_id":"4d0f6c57-8050-4a67-91f6-09746cbaff6f","year":2025},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.797201Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:3970bcab46e3a980b18b3711d82ba8b43e27c53a469efb2b05ffbe7ce2289ae8","observation_id":"5e30fd84-e35e-4b66-8987-d6987b31df39","resolution":{"observed_at":"2026-08-06T14:36:30.825970Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T14:36:29.809595Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.809595Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:76e1503b987a2df409bb6ab3874047fa86fdf6a3d359acfe5b54e777ba619d59","observation_id":"87f6d969-dcfa-47c6-a344-a8830c003976","resolution":{"observed_at":"2026-08-06T14:36:29.809595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-07-06T16:31:25.350087Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-06T14:36:29.762895Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.762895Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:45abf340821fa469347134089e17fcaa85139b5ed96019fa2b86ab0eacd1cf28","observation_id":"535d5528-c211-40a6-89a1-41072bdde2d6","resolution":{"observed_at":"2026-08-06T14:36:29.762895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T14:36:29.862040Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.862040Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:79342e04995241e9ce50f21f1dfe6559280e47857bdac5d5e8f1aa07896875ab","observation_id":"97411bd4-bb74-4ae5-b95c-028126faebd9","resolution":{"observed_at":"2026-08-06T14:36:29.862040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:30.857955Z","title":null,"venue":null,"work_id":"e9073ec4-501d-4ebe-9a7b-91a0ae0dfa8f","year":2019},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.780390Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:ffb512eaffd373567ef075fdba68f7d62fe5abee5a9d2b7632fb30cac4bf7e85","observation_id":"03c16232-4046-467a-8847-08fb25ec7307","resolution":{"observed_at":"2026-08-06T14:36:30.864740Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.03715","last_updated":"2020-07-14T16:51:47Z","snapshot_observed_at":"2026-08-07T17:16:25.795212Z","submitted_at":"2020-03-08T04:34:58Z","title":"OVC-Net: Object-Oriented Video Captioning with Temporal Graph and Detail Enhancement","version":5},"cited_work":{"arxiv_id":"2003.03715","doi":null,"metadata_source":"pith","pith_arxiv_id":"2003.03715","snapshot_observed_at":"2026-08-06T14:36:30.015005Z","title":"OVC-Net: Object-Oriented Video Captioning with Temporal Graph and Detail Enhancement","venue":"cs.CV","work_id":"893ecbab-896a-4b7f-bb4d-0c6e533a5bf1","year":2020},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.835315Z"},"links":{"cited_paper":"/paper/2003.03715","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:8fe0ca12d91b26386a88aba62a5024d4d13197d640458026e6c00a9bcfe45a64","observation_id":"3d196621-58ea-4326-ad9c-5b540ec82e8b","resolution":{"observed_at":"2026-08-06T14:36:30.025967Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:31.225826Z","title":"In Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":"68328ce8-5527-46b6-b097-86736e26711c","year":null},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.515564Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:e4dc3f91d93e428bdb6e4fe6410a38b7a56055fc5f6e9dc3cdff39359162e15d","observation_id":"1c897235-9b2f-48d4-afe8-7c2a0937e9fc","resolution":{"observed_at":"2026-08-06T14:36:31.241487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:32.205915Z","title":"In Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":"5a57a287-cca5-454e-bf4b-cc32cd83d4ea","year":null},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.356331Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:4a9e5d6c36a03566fb5ea84b7208ee18770c78140a3d71920a0c979c7d3a34f0","observation_id":"9e3a30e2-4a94-4ba2-abf5-c0628384966f","resolution":{"observed_at":"2026-08-06T14:36:32.304827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:36:31.063804Z","title":"In 2020 IEEE International Conference on Multimedia and Expo (ICME)","venue":null,"work_id":"6e089f7a-9cb8-41f0-a20d-3fbf7996f446","year":2020},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:29.625877Z"},"links":{"citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:fef2dc0663b63f0c655946251bf4627bbfc66777027bbaa1f063155485d86dcd","observation_id":"4d657601-617a-4e66-80b6-9ff221e4d053","resolution":{"observed_at":"2026-08-06T14:36:31.068892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-06T14:36:28.852339Z","title":"arXiv preprint arXiv:2306.15195 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:28.852339Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2507.18531"},"observation_digest":"sha256:a0349701c78a077896a5db73e7d7b4c6ed8613499c5109da8ce3a54f201c5b83","observation_id":"a3898842-383a-46dc-bcdc-848142eec563","resolution":{"observed_at":"2026-08-06T14:36:28.852339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.18531","last_updated":"2025-07-24T15:58:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T22:13:34.998544Z","submitted_at":"2025-07-24T15:58:36Z","title":"IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":3,"verified_fuzzy":4},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 1 inbound Pith citation observation for arXiv:2507.18531."}