{"as_of":"2026-08-10T09:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5cc188b039a4864947888ceec06f8613af879140ad3bb4ca9a092eb3e022ac2b","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:29:20.024809Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.18880/citation-record","integrity":"/paper/2505.18880/integrity","json":"/paper/2505.18880/citation-record.json","paper":"/paper/2505.18880"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.15000","last_updated":"2024-06-21T09:26:55Z","snapshot_observed_at":"2026-08-08T12:16:12.490382Z","submitted_at":"2024-06-21T09:26:55Z","title":"Unveiling the Impact of Multi-Modal Interactions on User Engagement: A Comprehensive Evaluation in AI-driven Conversations","version":1},"cited_work":{"arxiv_id":"2406.15000","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.15000","snapshot_observed_at":"2026-08-07T14:29:21.446393Z","title":"Unveiling the Impact of Multi-Modal Interactions on User Engagement: A Comprehensive Evaluation in AI-driven Conversations","venue":"cs.CL","work_id":"67f3adea-a151-4a81-9a42-c421b8fa5830","year":2024},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:13.821285Z"},"links":{"cited_paper":"/paper/2406.15000","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:d753055f1893b052f86143d33aa7f1e95cafe28af6614dde19c5ec94dea3e353","observation_id":"e283872b-5db8-4bad-941b-ec7e50502c26","resolution":{"observed_at":"2026-08-07T14:29:21.503164Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:26.578778Z","title":"Eye tracking research on readers’ interactions with multimodal texts: a mini-review,","venue":null,"work_id":"55baefaf-ca81-4971-b93b-af13be153d04","year":2024},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:13.916042Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:2c93b7e650e10649d0e7ffccb820fe75a3111e209bd56acc0ad0f10e1601b482","observation_id":"0ad4a6d7-0ff3-401e-96a4-6481f86c5cd2","resolution":{"observed_at":"2026-08-07T14:29:26.679052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08670","last_updated":"2024-02-13T18:51:18Z","snapshot_observed_at":"2026-08-09T21:43:18.364114Z","submitted_at":"2024-02-13T18:51:18Z","title":"Rec-GPT4V: Multimodal Recommendation with Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08670","snapshot_observed_at":"2026-08-07T14:29:14.045791Z","title":"Rec-gpt4v: Multimodal recommendation with large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:14.045791Z"},"links":{"cited_paper":"/paper/2402.08670","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:9f52c8e05ea5e0029bd931e9e9a6f27ea3bad1009e00a1a30364e85a5a45a770","observation_id":"0433936a-d9d1-4d8a-a280-72766676c584","resolution":{"observed_at":"2026-08-07T14:29:14.045791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07284","last_updated":"2023-06-12T18:13:44Z","snapshot_observed_at":"2026-08-03T08:42:55.898240Z","submitted_at":"2023-03-13T17:01:42Z","title":"Align and Attend: Multimodal Summarization with Dual Contrastive Losses","version":3},"cited_work":{"arxiv_id":"2303.07284","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.07284","snapshot_observed_at":"2026-08-07T14:29:21.205679Z","title":"Align and Attend: Multimodal Summarization with Dual Contrastive Losses","venue":"cs.CV","work_id":"da8d9039-e3b2-4821-a747-9b476c426f9c","year":2023},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:14.172804Z"},"links":{"cited_paper":"/paper/2303.07284","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:ade42d8410cfd27601215393cb413ba89733aa36651087c0bac107c539c03c52","observation_id":"1db1b61d-28ea-4596-85e3-07d8a510e747","resolution":{"observed_at":"2026-08-07T14:29:21.304387Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:26.323127Z","title":"Plots to previews: Towards automatic movie preview retrieval using publicly available meta-data,","venue":null,"work_id":"3ec40f08-777a-4a70-af98-ecc571bc75c4","year":2021},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:14.351016Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:dae5d3b7173b0569b1c82412d7d2b16598fe87d8e57a0dd1260e82b64da9aee6","observation_id":"00ce0d9d-983b-4e37-a3ca-52c7d07980f0","resolution":{"observed_at":"2026-08-07T14:29:26.438855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:26.115225Z","title":"Smart trailer: Automatic generation of movie trailer using only subtitles,","venue":null,"work_id":"6aeaaaca-79a3-450f-8ad0-491d3a1f7ebd","year":2018},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:14.531827Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:3fdfa0cf927ac38c1e60860236f8739ddff355300e37b105906c90e41ad93c26","observation_id":"13544045-6944-48bc-9405-b1a1e51e3b48","resolution":{"observed_at":"2026-08-07T14:29:26.222279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:25.812534Z","title":"Automated production of tv program trailer using electronic program guide,","venue":null,"work_id":"be0ade67-5739-4144-9289-5d4b53316772","year":2007},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:14.693565Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:55127615053fb7d42723bd73a2324f2df6c053c6d4620379ad14e4a729c38917","observation_id":"eed9ce76-bd70-4e33-9c35-c2fa8e4ffea9","resolution":{"observed_at":"2026-08-07T14:29:25.949360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:25.558454Z","title":"User preferences for automated curation of snackable content,","venue":null,"work_id":"1a2662f0-3d33-439a-819a-151f84398d35","year":2021},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:14.865046Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:f03e9b11f374dd60145d36c7dc28a9bfabaa3539a15e5aabed277bf0d3a89490","observation_id":"197d26a8-09e8-4f18-b029-2e3352eb8a73","resolution":{"observed_at":"2026-08-07T14:29:25.704482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:25.226372Z","title":"Semi-supervised learning towards computerized generation of movie trailers,","venue":null,"work_id":"8c1f09b4-a4a9-4400-9e07-0307eb9c4561","year":2015},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:14.987099Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:d3fb4f62ef147f7a05498c897c2a7fc242930e2d948198ca96e0481990d353f7","observation_id":"b9a03670-b177-4baf-b368-8fedc86c964c","resolution":{"observed_at":"2026-08-07T14:29:25.364440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:24.834667Z","title":"Harnessing ai for augmenting creativity: Application to movie trailer creation,","venue":null,"work_id":"4aa74f7d-0ab3-4772-9c51-6f95a5c64690","year":2017},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:15.178708Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:3558129289b62c4d3670ac97edb4fc8c702ee323a89906e128d68f4677c9c7e8","observation_id":"4b8c28ea-9b35-487b-85a2-d777b4236464","resolution":{"observed_at":"2026-08-07T14:29:25.029017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05586","last_updated":"2024-11-10T02:20:47Z","snapshot_observed_at":"2026-08-06T09:11:18.171594Z","submitted_at":"2024-10-08T01:00:09Z","title":"TeaserGen: Generating Teasers for Long Documentaries","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05586","snapshot_observed_at":"2026-08-07T14:29:15.410134Z","title":"Teasergen: Generating teasers for long documentaries,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:15.410134Z"},"links":{"cited_paper":"/paper/2410.05586","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:ece2401975648c5d4a62cbc34d631b55535f374b5091028070ef0f0ac9dac15e","observation_id":"aca99c3f-e2a1-49bc-af14-dc0ae6b84918","resolution":{"observed_at":"2026-08-07T14:29:15.410134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05298","last_updated":"2025-04-07T17:56:31Z","snapshot_observed_at":"2026-08-07T16:07:51.376018Z","submitted_at":"2025-04-07T17:56:31Z","title":"One-Minute Video Generation with Test-Time Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05298","snapshot_observed_at":"2026-08-07T14:29:15.602226Z","title":"One-minute video generation with test-time training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:15.602226Z"},"links":{"cited_paper":"/paper/2504.05298","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:1851eeffaeda2c978174d93ba87d56cdf60b15bfef300c2bac74dbf46b500b89","observation_id":"fe89d4ab-7b8b-4ef2-85f4-91b98e647d97","resolution":{"observed_at":"2026-08-07T14:29:15.602226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:15.802195Z","title":"Survey of hallucination in natural language generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:15.802195Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:a139f60f048416eb87d921f99f78b6e97455ab691189a3f7c0ae076e1e53454e","observation_id":"e553459f-b397-4015-b369-eef08cd93f86","resolution":{"observed_at":"2026-08-07T14:29:15.802195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18930","snapshot_observed_at":"2026-08-07T14:29:15.936001Z","title":"Hallucination of multimodal large language models: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:15.936001Z"},"links":{"cited_paper":"/paper/2404.18930","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:772fd63c15572eacb46174073c8414562cacf4229b9e468036faf821fb695fa7","observation_id":"29897abb-c2d5-43f6-8d74-e31bb57dbd17","resolution":{"observed_at":"2026-08-07T14:29:15.936001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11817","last_updated":"2025-02-13T08:11:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-22T10:26:14Z","title":"Hallucination is Inevitable: An Innate Limitation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11817","snapshot_observed_at":"2026-08-07T14:29:16.063811Z","title":"Hallucination is inevitable: An innate limitation of large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:16.063811Z"},"links":{"cited_paper":"/paper/2401.11817","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:c81ecd3a658cf8a37df20992a811af81fd6d2479fb6415f6a6a428d967f52e74","observation_id":"5e603a2a-4222-4987-b25f-7b9a4cfa8408","resolution":{"observed_at":"2026-08-07T14:29:16.063811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00747","last_updated":"2023-07-11T17:07:19Z","snapshot_observed_at":"2026-08-07T11:26:26.674534Z","submitted_at":"2023-03-01T18:59:13Z","title":"WhisperX: Time-Accurate Speech Transcription of Long-Form Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00747","snapshot_observed_at":"2026-08-07T14:29:16.220352Z","title":"Whisperx: Time-accurate speech transcription of long-form audio,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:16.220352Z"},"links":{"cited_paper":"/paper/2303.00747","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:3f9946b51941fadbf54817d66b5556d61138b428cb56698544060249ecc3ded5","observation_id":"1327115d-b2b1-4216-9fde-40745f918d60","resolution":{"observed_at":"2026-08-07T14:29:16.220352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08037","last_updated":"2023-02-10T20:04:05Z","snapshot_observed_at":"2026-07-06T14:31:07.280398Z","submitted_at":"2022-12-15T18:45:29Z","title":"Attributed Question Answering: Evaluation and Modeling for Attributed Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08037","snapshot_observed_at":"2026-08-07T14:29:16.346157Z","title":"Attributed question answering: Evaluation and modeling for attributed large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:16.346157Z"},"links":{"cited_paper":"/paper/2212.08037","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:129cb2ba3365b3794e839d665c68287dd8fa355a0baa5615cd9c7b90d19aa04e","observation_id":"6e73a2d4-e2f9-4bc2-9450-016286e49751","resolution":{"observed_at":"2026-08-07T14:29:16.346157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:24.461190Z","title":"Learning fine-grained grounded citations for attributed large language models,","venue":null,"work_id":"6d6a7004-338b-4c8c-b8b7-2ade32adc44d","year":2024},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:16.506154Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:5fb269df6d250e8a6737d35ff0964947246bda57f556d04d1539d0d6accb16c2","observation_id":"5b05f4e7-53e9-411b-b496-e02bacec2437","resolution":{"observed_at":"2026-08-07T14:29:24.643144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:24.128899Z","title":"Dense passage retrieval for open-domain question answering,","venue":null,"work_id":"cc26082c-d221-444a-987f-9d690395a164","year":2020},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:16.633785Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:9213da2a806f61f8b4dee9b0c7e0dfc042b89be83ec78b6af35efe79565166b1","observation_id":"a993bad8-35ba-41a8-be34-26186ba1df4d","resolution":{"observed_at":"2026-08-07T14:29:24.306266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:23.834092Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks,","venue":null,"work_id":"e5abbaf6-74ce-4261-9cd5-2739f68e4ac0","year":2020},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:16.718104Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:7f82e8dc025bde9ceb1a8097c7750116dd1ef4a9093ad4974e98d4be8567a560","observation_id":"d28dce8e-ab53-42e9-9971-22ecf4a5c47b","resolution":{"observed_at":"2026-08-07T14:29:23.966223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05876","last_updated":"2024-10-23T14:48:20Z","snapshot_observed_at":"2026-08-05T14:42:13.473991Z","submitted_at":"2023-11-10T05:24:04Z","title":"Trends in Integration of Knowledge and Large Language Models: A Survey and Taxonomy of Methods, Benchmarks, and Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05876","snapshot_observed_at":"2026-08-07T14:29:16.912491Z","title":"Trends in integration of knowledge and large language models: A survey and taxonomy of methods, benchmarks, and applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:16.912491Z"},"links":{"cited_paper":"/paper/2311.05876","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:f9dae014b166cd700e9f74f69712fcd945d93669f24958596da64a4408cf9715","observation_id":"0b85dbfe-06a0-4221-a98a-74327f2cff90","resolution":{"observed_at":"2026-08-07T14:29:16.912491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-07T14:29:17.043717Z","title":"Lamda: Language models for dialog applications,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:17.043717Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:9f87ff948dada82b1fa7ab4a85ca6773546d8ad76d83216ae8bbae1bf03eccaa","observation_id":"8261d55b-cc8e-4d76-b4cf-386f27004647","resolution":{"observed_at":"2026-08-07T14:29:17.043717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:23.452845Z","title":"Evaluating verifiability in generative search engines,","venue":null,"work_id":"e09ac7d0-42b0-4cef-8fbb-de43e6f6f9ac","year":2023},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:17.243963Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:6904af0fec223f920148d58b60fe6133fd3a9c7a29b80cd96a0cd25270e78590","observation_id":"d94cd4b9-6c70-47ac-8b0d-943d15a76c7a","resolution":{"observed_at":"2026-08-07T14:29:23.618273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:23.166469Z","title":"Clip-it! language-guided video summarization,","venue":null,"work_id":"4833623d-033d-490d-9d0f-ca670130b847","year":2021},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:17.345158Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:ad3266e138879f6c069d2db9d0c1c925c1905ec9ae1b8985e52d3e94dd7194d2","observation_id":"6cbb0576-5b99-4f9c-bec4-1132ffa6d156","resolution":{"observed_at":"2026-08-07T14:29:23.296737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03398","last_updated":"2024-04-04T11:59:06Z","snapshot_observed_at":"2026-08-09T02:31:58.801139Z","submitted_at":"2024-04-04T11:59:06Z","title":"Scaling Up Video Summarization Pretraining with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03398","snapshot_observed_at":"2026-08-07T14:29:17.536205Z","title":"Scaling up video summarization pretraining with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:17.536205Z"},"links":{"cited_paper":"/paper/2404.03398","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:cb59751e3eb315e3987d07419d17e441cdffe20986ba123349df705b7c3b97f5","observation_id":"755f5b7f-afd3-40d4-8d6d-1b04e322d7a3","resolution":{"observed_at":"2026-08-07T14:29:17.536205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03477","last_updated":"2024-04-04T14:28:34Z","snapshot_observed_at":"2026-08-04T10:54:34.276165Z","submitted_at":"2024-04-04T14:28:34Z","title":"Towards Automated Movie Trailer Generation","version":1},"cited_work":{"arxiv_id":"2404.03477","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.03477","snapshot_observed_at":"2026-08-07T14:29:20.825213Z","title":"Towards Automated Movie Trailer Generation","venue":"cs.CV","work_id":"8df4a004-f40a-4eae-9698-360c1e057cc1","year":2024},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:17.663260Z"},"links":{"cited_paper":"/paper/2404.03477","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:72eae046ad80316cf7b4f71483b70317e93b5afd1349998e94c3cd69854f7bc5","observation_id":"794680f7-d888-4de9-9749-587bbb685941","resolution":{"observed_at":"2026-08-07T14:29:20.939408Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:22.896386Z","title":"\"previously on","venue":null,"work_id":"1d1284ad-9942-4743-9167-be9640b781e7","year":null},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:17.787983Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:56be53f885b1992a386188bffb694b6c4fd785812878bfee91d6dce04bfb40dd","observation_id":"995a39ee-b9a4-46ae-b5a6-42bfa0740cc9","resolution":{"observed_at":"2026-08-07T14:29:23.046760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:22.573692Z","title":"Videoxum: Cross-modal visual and textural summarization of videos,","venue":null,"work_id":"27b7b235-8641-4e85-af94-68b157589a38","year":2023},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:18.143672Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:37a2e6ddbb1d619d718a755bf860f0b840872adef27bdc1f6fc9af48d7d65da8","observation_id":"b5b07bb0-2b4b-428a-bf4c-084710c66a73","resolution":{"observed_at":"2026-08-07T14:29:22.767143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:29:18.310362Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:18.310362Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:9f8834d92ca87bee42b2e24c94f4115c0e0d2abb36a537710551685aa527400e","observation_id":"8f9a7602-70c7-4fb0-a5ed-075663663f95","resolution":{"observed_at":"2026-08-07T14:29:18.310362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T14:29:18.464070Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:18.464070Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:e0c320d82d3dd9912df9633b6528eda759c536ef5e54174c6c81dd28afebee47","observation_id":"611a5f88-a102-4d55-b1a4-5aa99f99c993","resolution":{"observed_at":"2026-08-07T14:29:18.464070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:22.319312Z","title":"Univtg: Towards unified video-language temporal grounding,","venue":null,"work_id":"beada131-8bbf-46b0-8dd9-a5884b47fd70","year":2023},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:18.600886Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:5ce710e7a001c999f8902a3dc7e5b23cee503cdfe22e8fe489e205f753fcb578","observation_id":"15dfc0bf-8ef2-4f11-b1c5-172cd213cab2","resolution":{"observed_at":"2026-08-07T14:29:22.428707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:22.230077Z","title":"BART: Denoising sequence-to-sequence pre-training for natural language generation, translation, and comprehension,","venue":null,"work_id":"1226cccb-b4c7-4050-96a0-9d054ce02df0","year":2020},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:18.746817Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:19bca677dee8344a69a37c9742a20e040eacca73e5649eb2f42206e612bfedbf","observation_id":"b9fd862c-5ee2-4632-8fa3-04215822810b","resolution":{"observed_at":"2026-08-07T14:29:22.276219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:22.064766Z","title":"Sentence-Transformers/all-mpnet-base-v2,","venue":null,"work_id":"b38d4da2-f860-4396-a325-92be257a60b2","year":2022},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:18.921410Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:ba70557cd75cb65916168b4b766bd7eac01353d63ed87b7d2ced036e0a99bc39","observation_id":"a8ac58e6-26a8-49dd-8ca4-04d4c6d8141b","resolution":{"observed_at":"2026-08-07T14:29:22.152397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:19.091604Z","title":"ROUGE: A package for automatic evaluation of summaries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:19.091604Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:3c73ae3f239a7afe8c18983273605b5d237186623ca0b92962cf53778dc23422","observation_id":"33152d2e-3f97-487e-8a01-c14956feedc9","resolution":{"observed_at":"2026-08-07T14:29:19.091604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16634","last_updated":"2023-05-23T22:12:16Z","snapshot_observed_at":"2026-08-02T04:02:36.848064Z","submitted_at":"2023-03-29T12:46:54Z","title":"G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16634","snapshot_observed_at":"2026-08-07T14:29:19.209163Z","title":"G-eval: Nlg evaluation using gpt-4 with better human alignment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:19.209163Z"},"links":{"cited_paper":"/paper/2303.16634","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:e1e747f502fde30e0785ad0c7f7a2433748743dc7c31c6062b0dfa91910846ed","observation_id":"5825d89c-5d59-42d6-8a1b-3f7c73a2da59","resolution":{"observed_at":"2026-08-07T14:29:19.209163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:21.832709Z","title":"DeepEval: The open-source llm evaluation framework,","venue":null,"work_id":"150338fe-433c-4e85-8999-8f2757c3f87f","year":2025},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:19.386401Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:3de4f9912bc4c5165e2c29313daa0d64dec5ab3fd9fcda78cc78b1370bd869e0","observation_id":"1a23693b-7bbf-4a73-bb6a-a94c48240283","resolution":{"observed_at":"2026-08-07T14:29:21.909800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-07T14:29:19.582613Z","title":"Clipscore: A reference-free evaluation metric for image captioning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:19.582613Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:2e38a532d8a562eb05b5a8f3797ff850aee5436e331b5350f815d67f32785d2a","observation_id":"6c7bcdc1-29a1-4a3e-a923-eb52436eb22f","resolution":{"observed_at":"2026-08-07T14:29:19.582613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:21.607036Z","title":"Screenwriter: Automatic screenplay generation and movie summarisation,","venue":null,"work_id":"c6916d0e-d49b-4fbb-9147-b28ec683367d","year":null},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:19.738415Z"},"links":{"citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:fd953bce77659460190b7ba1d3ac7e88c353975917c60ec1c20d8f64994c6621","observation_id":"157f6fda-85e1-463a-a81e-8843022d8fda","resolution":{"observed_at":"2026-08-07T14:29:21.731470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08080","last_updated":"2022-08-17T05:30:18Z","snapshot_observed_at":"2026-08-08T11:10:43.132356Z","submitted_at":"2022-08-17T05:30:18Z","title":"Multimodal Lecture Presentations Dataset: Understanding Multimodality in Educational Slides","version":1},"cited_work":{"arxiv_id":"2208.08080","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.08080","snapshot_observed_at":"2026-08-07T14:29:20.203821Z","title":"Multimodal Lecture Presentations Dataset: Understanding Multimodality in Educational Slides","venue":"cs.AI","work_id":"3675c490-1bf4-4cf6-b116-3a885b5e32f8","year":2022},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:20.024809Z"},"links":{"cited_paper":"/paper/2208.08080","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:e522a46932fbd10771831cfd2738950b4f357005a790736a7202d5b53fac2c8c","observation_id":"774a4142-778a-4689-83df-0ffee8a6b303","resolution":{"observed_at":"2026-08-07T14:29:20.283989Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19809","last_updated":"2024-10-17T07:59:54Z","snapshot_observed_at":"2026-08-03T05:31:05.504399Z","submitted_at":"2024-10-17T07:59:54Z","title":"ScreenWriter: Automatic Screenplay Generation and Movie Summarisation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19809","snapshot_observed_at":"2026-08-07T14:29:19.875241Z","title":"Available: https://arxiv.org/abs/2410.19809","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:19.875241Z"},"links":{"cited_paper":"/paper/2410.19809","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:89832164a4c5cf72ca32a089a014308d0cdcdd5267801d1869ddb85b5da670e2","observation_id":"7b99f98a-f4e5-4dfd-9b63-c8b86f0a807a","resolution":{"observed_at":"2026-08-07T14:29:19.875241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11487","last_updated":"2024-05-19T09:09:54Z","snapshot_observed_at":"2026-07-06T18:16:20.122022Z","submitted_at":"2024-05-19T09:09:54Z","title":"\"Previously on ...\" From Recaps to Story Summarization","version":1},"cited_work":{"arxiv_id":"2405.11487","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.11487","snapshot_observed_at":"2026-08-07T14:29:20.557390Z","title":"\"Previously on ...\" From Recaps to Story Summarization","venue":"cs.CV","work_id":"e035a66c-fdd9-488d-8d40-86336484e826","year":2024},"citing_paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:17.974793Z"},"links":{"cited_paper":"/paper/2405.11487","citing_paper":"/paper/2505.18880"},"observation_digest":"sha256:3f1dd5e5ad2d9b54db3fa351ac08cd85132d6b8dd4c71cc11dc7023b5866cf9c","observation_id":"2576b8f1-a8db-442e-b5c9-50ee6f3a5698","resolution":{"observed_at":"2026-08-07T14:29:20.705164Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18880","last_updated":"2025-05-24T21:36:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:21:44.980371Z","submitted_at":"2025-05-24T21:36:49Z","title":"REGen: Multimodal Retrieval-Embedded Generation for Long-to-Short Video Editing"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":17,"verified_exact":3,"verified_fuzzy":19},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2505.18880."}