{"as_of":"2026-08-22T23:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:432692f4a8b3fc95df983ba2e8a2ec5feadc68787324acd2b1b8adb1447341b7","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:49:30.743524Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.16082/citation-record","integrity":"/paper/2506.16082/integrity","json":"/paper/2506.16082/citation-record.json","paper":"/paper/2506.16082"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.279041Z","title":"Swinbert: End-to-end transformers with sparse attention for video captioning,","venue":null,"work_id":"1de695da-74eb-4b24-9ce1-5830acd004bd","year":2022},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.533987Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:d34bceea76436fbc837f34b8455c2a563c1bf81ae92b96da90c6b5baee33c1f3","observation_id":"fa5e75c7-e623-44cf-a38d-39cffd799f59","resolution":{"observed_at":"2026-08-06T23:49:31.281463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.271853Z","title":"Univl: A unified video and language pre-training model for multimodal understanding and generation,","venue":null,"work_id":"d5c41768-b794-4776-bb83-6d0c77f07539","year":2020},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.538020Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:483e28832139a0f0c3e56ab0aa543294c5b68e0cd62c125c8165ca7eecaf2e63","observation_id":"1d89fd1c-5d43-41f3-b082-3be8c3e7a0bd","resolution":{"observed_at":"2026-08-06T23:49:31.274458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.264935Z","title":"End-to-end generative pretraining for multimodal video captioning,","venue":null,"work_id":"71ff7cc4-5fcc-46a0-a982-78caf1de7346","year":2022},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.541611Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:fbbb3b57ce59aab139f07cdac9f7be69334eb8ad41fbd01cfc83e38e2ca171a4","observation_id":"44fa5252-8e30-4483-9f19-d2bcfec2807d","resolution":{"observed_at":"2026-08-06T23:49:31.267518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.257905Z","title":"Memory- attended recurrent network for video captioning,","venue":null,"work_id":"1868a41f-31c0-406f-be92-717c61c49d86","year":2019},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.545285Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:89b3239da75e3733491dc11a44dd0328c4cbbf1bb07c595b01fdae8eb1f61cee","observation_id":"e4831189-774a-4eac-8d97-886958a8f233","resolution":{"observed_at":"2026-08-06T23:49:31.260793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.251250Z","title":"Sports video captioning via attentive motion representation and group relationship modeling,","venue":null,"work_id":"f9bee020-1624-4b41-938d-e091b27abc05","year":2019},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.548825Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:6f4adaa94c7f50b82ac5818b789446d2449ddd0171c133a6d8a6e7b363f27edd","observation_id":"113ddb04-1b16-413b-99b6-452427e883e1","resolution":{"observed_at":"2026-08-06T23:49:31.253789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.244301Z","title":"Reconstruction network for video captioning,","venue":null,"work_id":"7f7e2fed-a2b6-43f4-b88e-2fca0fb6a642","year":2018},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.551991Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:35cfeffbb8596aa1765471625a90830ec3589efcf050139099249622172f57f3","observation_id":"d43601c3-4508-4875-bfd2-808817b94359","resolution":{"observed_at":"2026-08-06T23:49:31.246803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.234151Z","title":"Concept-aware video captioning: Describing videos with effective prior information,","venue":null,"work_id":"0ea31bc7-12cc-465a-8c68-f971dc586cba","year":2023},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.555325Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:9a71e25c95a6ba2575201148b016dc6f797708daea5163054e5f66b882ff707e","observation_id":"10703529-50cb-490d-9161-a037c9997068","resolution":{"observed_at":"2026-08-06T23:49:31.238970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.224606Z","title":"Dense- captioning events in videos,","venue":null,"work_id":"ee3de749-6910-4d1a-9a89-ac14818bb086","year":2017},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.559277Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:16000ec9acdf263f3799744db77b3e4fe6432ac972b5f5d8e1d9a6a53bf999b9","observation_id":"ae159af9-be8a-438c-b1f6-4b7a4d07989c","resolution":{"observed_at":"2026-08-06T23:49:31.227919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.215206Z","title":"Jointly localizing and describing events for dense video captioning,","venue":null,"work_id":"a396e113-ca80-4eb7-8307-519218d01fae","year":2018},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.562266Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:cf82917a31ec4d4d1ed6ed154f176e80f4b4686c30d80dbf06d8f244dd08320f","observation_id":"cfeb5a98-db2d-42d5-9589-5adad7828359","resolution":{"observed_at":"2026-08-06T23:49:31.219010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.206580Z","title":"End-to- end dense video captioning with parallel decoding,","venue":null,"work_id":"cb5fc3a7-d0b9-441a-b0c0-0743cd623000","year":2021},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.565004Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:f6fca9517a684fbaea0d0a6da7052c741b6670a86becb33ec6a1d32549f13c10","observation_id":"1822c6d2-42aa-4df6-b921-e077a0235f16","resolution":{"observed_at":"2026-08-06T23:49:31.209998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.196834Z","title":"Vid2seq: Large-scale pretraining of a visual language model for dense video captioning,","venue":null,"work_id":"c2354423-1f8e-42c5-956b-b1cdd4ef264f","year":2023},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.568648Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:6da9acd7e04c3bae62ed183f19b6252f41f2a1ace50f4d33e6c8e515bfe28b96","observation_id":"11f72725-4a3f-4343-a00f-0edd60a4472f","resolution":{"observed_at":"2026-08-06T23:49:31.200147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.188057Z","title":"Cap4video: What can auxiliary captions do for text-video retrieval?","venue":null,"work_id":"cd4b0856-a392-44fc-9ec0-dd9275e2e837","year":2023},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.571989Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:4a62f5776147774974e538769abfe5c43f800d950f3f67eb82e8544feb53a9c3","observation_id":"542d302d-477c-4189-895d-7c8ed67132f5","resolution":{"observed_at":"2026-08-06T23:49:31.191147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.179705Z","title":"Multi-event video-text retrieval,","venue":null,"work_id":"9195087a-afcd-4020-9601-134a76df0ed5","year":2023},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.574902Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:0608b671061c1aec2a6355b00de51862c84fc6d33b8ba7f46c9bc3ef47e5684f","observation_id":"d891ad30-fab8-40a4-8db5-83a0afcbc4d0","resolution":{"observed_at":"2026-08-06T23:49:31.182933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.171424Z","title":"Exploiting unlabeled videos for video-text retrieval via pseudo-supervised learning,","venue":null,"work_id":"f06f3ad0-d5e0-45a2-892d-9b825cf1a649","year":2024},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.577717Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:b75b5ea17b35360ec59316facf542e1319bc2fdbbfb1fa402992d28b6cd474cd","observation_id":"f2c9c0eb-2240-4a09-8218-19fdfc163885","resolution":{"observed_at":"2026-08-06T23:49:31.174629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.162580Z","title":"Video recap: Recursive captioning of hour-long videos,","venue":null,"work_id":"a28e7575-2ec5-40d7-9c1d-756db4a4f1c4","year":2024},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.580462Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:71a2684330797d519ac983249e2a65ca6822bd0567ef30e1a5376d47fc9f484a","observation_id":"4e662bfc-e59e-4372-9249-c8be4ba23f18","resolution":{"observed_at":"2026-08-06T23:49:31.165632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.152671Z","title":"Vidchapters- 7m: Video chapters at scale,","venue":null,"work_id":"01c4331c-a0b0-4916-afcc-025364922043","year":2023},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.583741Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:d25a5d61cdf6eb155c5491b3069786ae76361978676280fb7f7b47e8a1de7218","observation_id":"5699f10b-f5c1-46ad-b6f2-758d831f54c2","resolution":{"observed_at":"2026-08-06T23:49:31.156243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.143750Z","title":"Hierarchical representation network with auxiliary tasks for video captioning and video question answering,","venue":null,"work_id":"b65fc6c9-db57-4a9c-947e-19998727961f","year":2021},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.586459Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:ca14f17b9fbc0cae8c063eb9051dfd1566cdafd792c2bc7a5eef63004065a849","observation_id":"0bc1ec0c-a38e-4e8d-b366-121891cef46e","resolution":{"observed_at":"2026-08-06T23:49:31.147504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.135466Z","title":"Multi-modal dense video captioning,","venue":null,"work_id":"299e0919-46cb-4285-9237-a9fa0013c7b9","year":2020},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.589292Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:229d5f645ad98d3cc22443d65eb8d6dce4b2a426fd083f5b2095ce9a48536ee4","observation_id":"ad283bb7-0429-447c-b561-e24c5efdff8a","resolution":{"observed_at":"2026-08-06T23:49:31.138529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08271","last_updated":"2020-08-11T09:17:48Z","snapshot_observed_at":"2026-08-04T09:29:58.364575Z","submitted_at":"2020-05-17T15:00:05Z","title":"A Better Use of Audio-Visual Cues: Dense Video Captioning with Bi-modal Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08271","snapshot_observed_at":"2026-08-06T23:49:30.592133Z","title":"A better use of audio-visual cues: Dense video captioning with bi-modal transformer,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.592133Z"},"links":{"cited_paper":"/paper/2005.08271","citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:04555b435343256733445097dc14091cac1c1c5797194da58cf1d99c89210f17","observation_id":"ab34a21b-64be-463e-a64b-1a9239f2c474","resolution":{"observed_at":"2026-08-06T23:49:30.592133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.126501Z","title":"Hierarchical context encoding for events caption- ing in videos,","venue":null,"work_id":"937729df-a3e3-4f82-9ea4-8ba15e55b410","year":2018},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.595745Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:08f7aff4dace04565991195ae98adf0bbb60897402b3b9d14f50e28692e76e0d","observation_id":"1b4428d7-f918-40f0-af3a-9538660fe4e1","resolution":{"observed_at":"2026-08-06T23:49:31.130059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.598874Z","title":"End-to-end object detection with transformers,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.598874Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:9b55d2b679eee05a63d66bc62859902361eddfadba829d86936dab6e764657aa","observation_id":"3aed2096-8ddd-4045-a9a1-361f48bb4193","resolution":{"observed_at":"2026-08-06T23:49:30.598874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.113548Z","title":"Do you remember? dense video captioning with cross-modal memory retrieval,","venue":null,"work_id":"0189107c-5077-412d-872c-91a595a2137c","year":2024},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.601360Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:26d598e4b3cf831aa5769ffa28805225951a8c0f45a40d39766de3e5f13ec03e","observation_id":"794f98ca-fcfe-46b4-94b1-bf96aafb570d","resolution":{"observed_at":"2026-08-06T23:49:31.116790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.105638Z","title":"Parallel pathway dense video captioning with deformable transformer,","venue":null,"work_id":"58cbf548-90a8-4270-a2e5-f18071331fc0","year":2022},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.604312Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:96a3db3892f70cd3ca78ec133fd11a6fcd3d6966a4f21c017b2b1a1dee54b678","observation_id":"f70b8490-cd78-443e-bf6e-3592beb5a3a6","resolution":{"observed_at":"2026-08-06T23:49:31.108621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.097539Z","title":"Dibs: Enhancing dense video captioning with unlabeled videos via pseudo boundary enrichment and online refinement,","venue":null,"work_id":"e56e8a4b-a013-4d08-8094-e0a3df367933","year":2024},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.607160Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:2510faacba5c744773434bfcab80f108d68b4fabbefd695d68d8681943397a5b","observation_id":"2a23eb09-4550-4e63-901e-be803f5120dc","resolution":{"observed_at":"2026-08-06T23:49:31.100504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.087951Z","title":"Towards automatic learning of procedures from web instructional videos,","venue":null,"work_id":"47e80aa6-b702-4a1b-afd1-1d7ba31b5046","year":2018},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.609759Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:490dafc2526c7377dcc762ad7c13f97dc36f7c33277343d780e3b5ce834da3a6","observation_id":"0f88833e-93cf-45b4-90b9-7002b9add345","resolution":{"observed_at":"2026-08-06T23:49:31.092046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.078799Z","title":"Bidirectional attentive fusion with context gating for dense video captioning,","venue":null,"work_id":"cbec6c08-91a1-486a-abae-053389b92193","year":2018},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.612617Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:79804768117f48d6f46387295edbc120c1537508610db6552b3fbed6b81c5d81","observation_id":"ca198214-842b-4c2c-9d69-00f1bbf8c895","resolution":{"observed_at":"2026-08-06T23:49:31.081982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.059841Z","title":"Sketch, ground, and refine: Top-down dense video captioning,","venue":null,"work_id":"1a62ffaa-dc85-47ce-b887-b92600f27c7b","year":2021},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.619718Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:852779074e3e03485c3a711ac0e80e7e35a7969f2dad9ff27c7edb76fd3e7384","observation_id":"67355e09-8a00-4481-bef1-1ce32a7536e0","resolution":{"observed_at":"2026-08-06T23:49:31.063355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.07735","last_updated":"2020-11-16T05:44:45Z","snapshot_observed_at":"2026-08-22T00:14:08.193544Z","submitted_at":"2020-11-16T05:44:45Z","title":"iPerceive: Applying Common-Sense Reasoning to Multi-Modal Dense Video Captioning and Video Question Answering","version":1},"cited_work":{"arxiv_id":"2011.07735","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.07735","snapshot_observed_at":"2026-08-06T23:49:30.811814Z","title":"iPerceive: Applying Common-Sense Reasoning to Multi-Modal Dense Video Captioning and Video Question Answering","venue":"cs.CV","work_id":"781501cc-e745-45b5-b41d-332299496fbb","year":2020},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.622323Z"},"links":{"cited_paper":"/paper/2011.07735","citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:916f9b2c640eaeff37117386aafdfafde1078cdf6db4a90396908798919142a3","observation_id":"5ed51ade-4dbb-4174-b9d4-1445d517539f","resolution":{"observed_at":"2026-08-06T23:49:30.817671Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.050805Z","title":"Towards bridging event captioner and sentence localizer for weakly supervised dense event captioning,","venue":null,"work_id":"6588ff78-64ae-4164-97c5-bcc48b9bf4ff","year":2021},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.625464Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:aea4662bedd1a35beb9be0ad4b850f05955057febc3ed3e4e1ce73e0c33fb78f","observation_id":"790c75d0-3028-4619-9d21-93b99435fccb","resolution":{"observed_at":"2026-08-06T23:49:31.054536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.041723Z","title":"Streamlined dense video captioning,","venue":null,"work_id":"e3484da9-e665-48ae-93a8-75e39decece0","year":2019},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.629079Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:7c6a1e16de811c38bbc0c5ef5185eb649d1b6220304197ccd3e0aa2a32d4e229","observation_id":"ec21ce32-6afd-4ff0-b1c6-82e02b299266","resolution":{"observed_at":"2026-08-06T23:49:31.045077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.033342Z","title":"Watch, listen and tell: Multi- modal weakly supervised dense event captioning,","venue":null,"work_id":"fc4c1259-f6ca-40b7-bde0-917096163c47","year":2019},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.632967Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:e4cc69f4d5498cee688abd38b036ff3ded166ee2a08caaecb8873bf35ad12969","observation_id":"31f8ffc7-98bc-439b-9cf4-32cdbbc7a81d","resolution":{"observed_at":"2026-08-06T23:49:31.036326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.025171Z","title":"Dense procedure captioning in narrated instructional videos,","venue":null,"work_id":"6de691d9-a537-4630-9e30-2432d0116bf6","year":2019},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.636182Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:de00a4dc23a86c54e891a5f7fae05839832bb9f10b9a1e35bf51f7e236533c0f","observation_id":"ef6ff805-c600-4479-8e8e-ce78bfbff472","resolution":{"observed_at":"2026-08-06T23:49:31.028261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.639410Z","title":"Retrieval- augmented generation for knowledge-intensive nlp tasks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.639410Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:4d942c836b20da9f131a0b95b605d54a5544bc65aca3822c05fe2774f8ccf261","observation_id":"a99fc2d2-df09-4f3c-8b8a-7e48293598ba","resolution":{"observed_at":"2026-08-06T23:49:30.639410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.011974Z","title":"Streaming dense video captioning,","venue":null,"work_id":"6dbe9283-79a0-4432-a48d-4c2fa8653d4b","year":2024},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.642357Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:ef066675626244055ccb5a315e87c82904a953a78305be687965b15cb9a085b8","observation_id":"01aac300-6314-4204-b877-fb2c2bf0ad17","resolution":{"observed_at":"2026-08-06T23:49:31.014998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T23:49:30.645161Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.645161Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:e6564a3e8958a5d1b9e289b675d56f20be983d3413e4a58d03af5517977ea024","observation_id":"f24b0380-e52d-42a3-9f68-cff204ddeec8","resolution":{"observed_at":"2026-08-06T23:49:30.645161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.003674Z","title":"Learning texture transformer network for image super-resolution,","venue":null,"work_id":"f4f21661-6a37-418e-a9bc-832c579353b6","year":2020},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.647963Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:43fd9d27d00a6e420d255683dcef8c4c370f27a59301f270b7406fc740f6ccce","observation_id":"b8abfb3a-ee01-41e9-aca8-7db98dba97f2","resolution":{"observed_at":"2026-08-06T23:49:31.006881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.995206Z","title":"Siamese-detr for generic multi-object tracking,","venue":null,"work_id":"7c42521d-7183-4d68-8729-a9f99bdce5f3","year":2024},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.650996Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:0995cb2f2385a628fe9f1bad65d82cb0324b34e53722641e7b6d694c2c9705a3","observation_id":"f755325a-cf61-4d1f-8217-8c1c20993a7f","resolution":{"observed_at":"2026-08-06T23:49:30.998262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.653780Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.653780Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:fd08e1b5c800ce9aac41aec45742eac66568e9df8af4f8f09c89f9e7a7ffad88","observation_id":"655c5caf-df19-4c6f-82d8-1c05d1e651d4","resolution":{"observed_at":"2026-08-06T23:49:30.653780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.656528Z","title":"Spectralgpt: Spectral remote sensing foun- dation model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.656528Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:ece15c0b9ab6adb7f55db3fddb899bd4f8128b458bd3e81856d23777e1c735a1","observation_id":"06e03206-93a2-498f-9b16-467cad8297a0","resolution":{"observed_at":"2026-08-06T23:49:30.656528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.659718Z","title":"Segment anything in medical images,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.659718Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:9bb0244b2c4e3ef1189eefacf2593b07882893cf8c72867d3d158caecaa5b8d5","observation_id":"2f31e8ee-f887-4a7a-96eb-47f4b62d8179","resolution":{"observed_at":"2026-08-06T23:49:30.659718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.973208Z","title":"Point to set similarity based deep feature learning for person re-identification,","venue":null,"work_id":"2aa4abf0-4a52-4716-b1d4-4e24144e9fea","year":2017},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.663035Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:f3ce32aca2a6bcc016ddfc52e24b4690565ccece54618eeb0adde6f552926ef4","observation_id":"e83cc329-7a9f-4831-a30e-7d562858aaaa","resolution":{"observed_at":"2026-08-06T23:49:30.976259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.963701Z","title":"Visual-linguistic feature align- ment with semantic and kinematic guidance for referring multi-object tracking,","venue":null,"work_id":"5e056b4b-be21-4c4d-99ff-71d4c93a4737","year":2025},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.666073Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:7d67fd153571053b5a347a09d55ef10e44bac57fc82d90a60acd3031b40a8d8b","observation_id":"2a888963-af32-49ba-a627-5475c9bec640","resolution":{"observed_at":"2026-08-06T23:49:30.967527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.954678Z","title":"Explainability enhanced object detection transformer with feature disentanglement,","venue":null,"work_id":"9dcca8d4-b827-4921-87bb-243730e43e68","year":2024},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.669729Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:1b9391aca39a1708d826cf4981fe94706fd2126cf61befe73589964923fae4ba","observation_id":"ca1d6cf8-70dc-426e-840d-56823da30168","resolution":{"observed_at":"2026-08-06T23:49:30.957909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-08-13T17:54:01.724774Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04159","snapshot_observed_at":"2026-08-06T23:49:30.672800Z","title":"Deformable detr: Deformable transformers for end-to-end object detection,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.672800Z"},"links":{"cited_paper":"/paper/2010.04159","citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:8ebfdd63d5bec196d3e01ea9d832df0fd7fde69388c3d5e403420d916762e45b","observation_id":"0992a42d-65ad-4aba-a10c-c5cd0f1dfdc8","resolution":{"observed_at":"2026-08-06T23:49:30.672800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.945625Z","title":"Fast temporal activity proposals for efficient detection of human actions in untrimmed videos,","venue":null,"work_id":"77d8f416-9925-4704-b54e-7751316e4559","year":2016},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.675862Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:3d4a9d908ac1c01a0119229394c240b55824c83af0c84871aef75cb2d27277b5","observation_id":"9095b9ae-19f1-417b-93fe-41701a75a88f","resolution":{"observed_at":"2026-08-06T23:49:30.949177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.936887Z","title":"Turn tap: Temporal unit regression network for temporal action proposals,","venue":null,"work_id":"a7310209-6969-4f37-a4a7-7d7fd192ff98","year":2017},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.678711Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:b28c6f930740d1f4a785e37092c7b756616a6db40a0f9e6bd846e29327d2904f","observation_id":"99bd5ad5-0eee-4749-8580-f048a6992829","resolution":{"observed_at":"2026-08-06T23:49:30.940183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.928938Z","title":"Daps: Deep action proposals for action understanding,","venue":null,"work_id":"c9b401cf-8b01-4eb4-ab61-dfc0c4cda256","year":2016},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.681671Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:05d5a51529ec8a96b6ee034607a875eba47789ca4927ab34abad92629885f259","observation_id":"2b2f46a3-1035-4d4e-a0ba-a3755a11b930","resolution":{"observed_at":"2026-08-06T23:49:30.931901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.918862Z","title":"Bmn: Boundary-matching network for temporal action proposal generation,","venue":null,"work_id":"166cefac-0ef0-4b0a-b878-8a8a39cf15ca","year":2019},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.684841Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:fd09ecc64375d3c06e900c3f7f28065fb1ea36280c8be853c186664f5e3fcfa2","observation_id":"3964fccf-844e-4393-8b9e-5d074e022e84","resolution":{"observed_at":"2026-08-06T23:49:30.923491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.910082Z","title":"Bsn: Boundary sensitive network for temporal action proposal generation,","venue":null,"work_id":"faf4b9c3-9fc2-45d6-a252-9bed82aecdb1","year":2018},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.687518Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:f376b153ed628f9e79f519cef5cbe9166748c95432b0a1ccc0870790787c1ecc","observation_id":"6a62d0aa-f909-4ba9-adb5-d9e489ea7341","resolution":{"observed_at":"2026-08-06T23:49:30.913477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.900830Z","title":"Temporal action detection with structured segment networks,","venue":null,"work_id":"1684e50a-4a03-4b75-a62d-0c5dc5ff66d1","year":2017},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.690224Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:e69fe66084c46cd5d16607ee94489a0f74d3a211e1b4d7d8d7436620c0212a5a","observation_id":"fff87b8a-cc00-4133-a777-d22d4d091316","resolution":{"observed_at":"2026-08-06T23:49:30.904862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.693135Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.693135Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:661c8d914c72d370f1d6ceb52697df459f084a946387e686af7fa018e65381a8","observation_id":"e99f9f09-0088-4c18-ab25-7fc4378b8618","resolution":{"observed_at":"2026-08-06T23:49:30.693135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.695794Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.695794Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:723b40fb619ac93b1fbe19c5c7f43a21852e0b8660fab679fa91fb2fec3fe3da","observation_id":"26838943-bc32-48b3-a35b-11a34589037b","resolution":{"observed_at":"2026-08-06T23:49:30.695794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.698590Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.698590Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:0a357f73d83068e5151a635176b3b7a8f7b89e4443902dd0ceb5d2efde695f10","observation_id":"d2378daf-4e9e-4f59-8b20-ba5aae863ffe","resolution":{"observed_at":"2026-08-06T23:49:30.698590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.702059Z","title":"The hungarian method for the assignment problem,","venue":null,"work_id":null,"year":1955},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.702059Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:adc14367c6285f2024b42732b72c6c4ca3e0f676d8732bf5b04de574a889b418","observation_id":"dad2060a-0920-499d-8779-5c23d59dc7e8","resolution":{"observed_at":"2026-08-06T23:49:30.702059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.705186Z","title":"Generalized intersection over union: A metric and a loss for bounding box regression,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.705186Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:06bc58c4f86c42e56a394a41f82d8bf000a12a66b7c0ac408348b2d4941545de","observation_id":"4a2d00ab-e957-48be-85e3-7dd8d9569679","resolution":{"observed_at":"2026-08-06T23:49:30.705186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.707762Z","title":"Focal loss for dense object detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.707762Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:d58e4191290802e45fd5531b009cf7f614da462f961ff783dd3eeae8c8d4defc","observation_id":"28fb2958-0a4d-4bef-b95f-b53ab4c74fca","resolution":{"observed_at":"2026-08-06T23:49:30.707762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T23:49:30.710577Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.710577Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:c30551fc80f677c8316768918a154121af0d0cf74be1f1428a59fe5100a3c5fd","observation_id":"02b0983d-d264-4de7-a0a4-78a13078d2d4","resolution":{"observed_at":"2026-08-06T23:49:30.710577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-06T23:49:30.713603Z","title":"Videochat: Chat-centric video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.713603Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:3b2b35fa183401a139fe71a510833ee63e876af82a668b4d26df93d1cbb12c33","observation_id":"d0abc37a-0e0c-421d-b03e-a92d76fd7b81","resolution":{"observed_at":"2026-08-06T23:49:30.713603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.716783Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.716783Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:5ba3b14d499e19326cf9e773940dad1840f24c04be422262fe28d872672cbd98","observation_id":"cf0a8937-3623-44e7-970f-abd7ac383a08","resolution":{"observed_at":"2026-08-06T23:49:30.716783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.08121","last_updated":"2022-09-16T05:44:53Z","snapshot_observed_at":"2026-08-16T17:06:25.534936Z","submitted_at":"2022-04-18T01:30:54Z","title":"End-to-end Dense Video Captioning as Sequence Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.08121","snapshot_observed_at":"2026-08-06T23:49:30.719432Z","title":"End- to-end dense video captioning as sequence generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.719432Z"},"links":{"cited_paper":"/paper/2204.08121","citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:4d08f090b7de7b495528a028710ffcf8fad7707a1afc51a3ef0246aec9903cb9","observation_id":"b96baa8c-f98f-4b68-aac6-179d53c9f81e","resolution":{"observed_at":"2026-08-06T23:49:30.719432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.861665Z","title":"Event-centric hier- archical representation for dense video captioning,","venue":null,"work_id":"34e4fe80-c9da-4a18-b68e-9ffb7da9f5aa","year":1900},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.722485Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:81789af3414c2eecb81774ad7be14c2829685a01a4724816a8207d6821fb0edf","observation_id":"add7b680-b287-4f8a-8d02-c4296cecaa0a","resolution":{"observed_at":"2026-08-06T23:49:30.865177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:31.069228Z","title":"End-to-end dense video captioning with masked transformer,","venue":null,"work_id":"b3ee224a-299e-4774-a818-74be35343581","year":2018},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.725394Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:025af7b1e1bbcc516c16f3a4599d30b9a1d8e96ce2270a73cdd40e8aa3b14f30","observation_id":"b5151edd-cabd-4bd3-8084-49f77d5a5779","resolution":{"observed_at":"2026-08-06T23:49:31.073170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11693","last_updated":"2020-08-12T03:44:21Z","snapshot_observed_at":"2026-08-19T20:42:16.095494Z","submitted_at":"2020-06-21T02:38:59Z","title":"Dense-Captioning Events in Videos: SYSU Submission to ActivityNet Challenge 2020","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11693","snapshot_observed_at":"2026-08-06T23:49:30.728030Z","title":"Dense-captioning events in videos: Sysu submission to activitynet challenge 2020,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.728030Z"},"links":{"cited_paper":"/paper/2006.11693","citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:b7a44a17b107c23e4ba922cf234331472caba17a1fd4b9e801338d23edc3bb9d","observation_id":"739b80c0-5372-437d-932c-593f7a4026f5","resolution":{"observed_at":"2026-08-06T23:49:30.728030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.731021Z","title":"Cider: Consensus- based image description evaluation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.731021Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:fcf81940508b1285ef40aeb63b512801d7784222a556c761adc248887c575a49","observation_id":"93559e2d-a349-4524-9cea-c70b6032fe40","resolution":{"observed_at":"2026-08-06T23:49:30.731021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.734331Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.734331Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:3b8d8135e1556ca34067442989e156d02be1dd296b5feaf0d6b7e9a4b7983a0c","observation_id":"9ef41eb8-1756-4316-bd3d-1e91b39e8633","resolution":{"observed_at":"2026-08-06T23:49:30.734331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.737908Z","title":"Meteor: An automatic metric for mt evalua- tion with improved correlation with human judgments,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.737908Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:c45db7c65543c5f99b9792aaa788c35593e0856605e2594dffde1994c131b64f","observation_id":"6ddaf0f5-115d-49e5-8bf2-e35f1bde38af","resolution":{"observed_at":"2026-08-06T23:49:30.737908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.839604Z","title":"Soda: Story oriented dense video captioning evaluation framework,","venue":null,"work_id":"6ac397d9-c0a9-46c7-aaf5-1dd9853e3cf6","year":2020},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.740876Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:f499ac4f63f1c749ce89349dad688198e0a0f60c7908267a7cb35e15c26975cc","observation_id":"2d775db5-68d8-4dba-8e81-96629aa209ef","resolution":{"observed_at":"2026-08-06T23:49:30.842462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:30.831196Z","title":"Move forward and tell: A progressive generator of video descriptions,","venue":null,"work_id":"afba3a72-6db8-4e49-9489-9f2aa8334959","year":2018},"citing_paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:30.743524Z"},"links":{"citing_paper":"/paper/2506.16082"},"observation_digest":"sha256:d27360486b73556a03031ed7126ba729ea7633b171b32e5de44a0208a9cfa5d0","observation_id":"560e4972-7cc4-490a-b7fa-6460964bbfeb","resolution":{"observed_at":"2026-08-06T23:49:30.834153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.16082","last_updated":"2025-06-19T07:07:42Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-22T00:14:25.788293Z","submitted_at":"2025-06-19T07:07:42Z","title":"PR-DETR: Injecting Position and Relation Prior for Dense Video Captioning"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":1,"verified_fuzzy":45},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2506.16082."}