{"as_of":"2026-08-15T17:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:da6b15bb2bb9669925ac6f17b296e728ad46748df0d369b462710de1da586111","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T18:15:11.185463Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:38:48.719839Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-10T22:38:49.070684Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"cited_work":{"arxiv_id":"2412.08147","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.08147","snapshot_observed_at":"2026-08-10T22:38:49.070684Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","venue":"cs.LG","work_id":"e8ed77c3-f806-4a6e-9b2f-b8b70ef3a70e","year":2024},"citing_paper":{"arxiv_id":"2501.01230","last_updated":"2025-05-26T13:01:08Z","snapshot_observed_at":"2026-08-15T03:51:53.442640Z","submitted_at":"2025-01-02T12:45:21Z","title":"Modeling Multi-Task Model Merging as Adaptive Projective Gradient Descent","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:48.719839Z"},"links":{"cited_paper":"/paper/2412.08147","citing_paper":"/paper/2501.01230"},"observation_digest":"sha256:102b943effb38697a4430ac0c6687c61128dd637cf29aa3b3b56fdc81d45aba8","observation_id":"2c191934-7008-4577-9c07-7205e8fa5185","resolution":{"observed_at":"2026-08-10T22:38:49.074989Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.08147/citation-record","integrity":"/paper/2412.08147/integrity","json":"/paper/2412.08147/citation-record.json","paper":"/paper/2412.08147"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.730523Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.730523Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:4b1d0fb381c77c754b1b5b51dead72c569926284c85a9c5abac61418bdf29935","observation_id":"395755ce-a8b7-4cf9-9dfb-08a3d245f1ba","resolution":{"observed_at":"2026-08-11T18:15:10.730523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.909708Z","title":"Muppet: Massive multi-task representations with pre-finetuning","venue":null,"work_id":"16d3f136-85ef-4614-940c-afb26d410e3b","year":2021},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.737695Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:ce21ad597acb8121c0e8d57dee60ebcbf123d91e0d51f89cd32b8dc82fb524ac","observation_id":"964b5bda-5aeb-4d6e-8f45-272fa8877e9f","resolution":{"observed_at":"2026-08-11T18:15:13.917923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.861037Z","title":"Safety-tuned LL a MA s: Lessons from improving the safety of large language models that follow instructions","venue":null,"work_id":"6bf1092e-5262-467b-981e-9c4fd1dae1a6","year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.743431Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:18b9cd11c8c7f0a031710f04f07cb46cfdb18c541efc49613756a221fa9c6fde","observation_id":"0e954d8c-e2b0-4e09-bfb8-138d5095de3f","resolution":{"observed_at":"2026-08-11T18:15:13.877649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.830747Z","title":"Neural networks for pattern recognition","venue":null,"work_id":"62c6b2bb-8ef8-459c-95d2-43bb831d46c7","year":1995},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.750856Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:eab88a7dfdd1c2626c8bde5837b6d49c04b5e6ae1b676d82f6e2db2cae8b1f2a","observation_id":"0b35ded3-ba47-40aa-b1b3-a6976ba82b26","resolution":{"observed_at":"2026-08-11T18:15:13.839602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.758533Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.758533Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:77bc44edd5bda17379340c86b4d9c0aa879e19cfa5d44d0a6b85f94e126ed384","observation_id":"de994e55-adbb-4314-b309-acbb17e2bb7b","resolution":{"observed_at":"2026-08-11T18:15:10.758533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.800948Z","title":"Mode-finding for mixtures of G aussian distributions","venue":null,"work_id":"556b8789-c405-47f4-9345-e1296cd3b24c","year":2000},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.765228Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:095fdaa6cb7ca5ef2ed2bd8022035407e11c87c11d5700cdf3054d1c75b90d5b","observation_id":"3d774df1-e3d0-4e8c-9950-48a0ca900174","resolution":{"observed_at":"2026-08-11T18:15:13.809183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.771952Z","title":"Multitask learning","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.771952Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:2e1d9f913abc5f54ec0980d99b6476b0875a324829a4afb77821da2d48fd4786","observation_id":"18c311c5-d512-4450-b645-bc3a55f4abe4","resolution":{"observed_at":"2026-08-11T18:15:10.771952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.769172Z","title":"PAC-B ayesian supervised classification: The thermodynamics of statistical learning","venue":null,"work_id":"ccc7bcfe-ee95-4ffa-af05-51d64e062952","year":2007},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.780121Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:02cad6413c6a130a5620f5bac3a0965dfc5d9ce5f54f3e9265449937c2fd592d","observation_id":"84cd8a65-06e0-402c-855d-eb11a7205484","resolution":{"observed_at":"2026-08-11T18:15:13.781424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.725485Z","title":"Overview of the IWSLT 2017 evaluation campaign","venue":null,"work_id":"7e73e63e-b03a-4a33-92f9-4bf655cb37e2","year":2017},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.787548Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:96760626066c15b22ef5d16e689f5cb71a3a07ac8c70e6e8c054a8e9ba0be40b","observation_id":"6fa95463-b68c-4400-805a-98fa617405d3","resolution":{"observed_at":"2026-08-11T18:15:13.739210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.694848Z","title":"GradNorm : Gradient normalization for adaptive loss balancing in deep multitask networks","venue":null,"work_id":"ed7f011e-74a3-48fc-9f71-a5b8d387705b","year":2018},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.795884Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:05ba8a82ffacc266e3df659caccd369b757c8645b5da910dff4e494db9c34eec","observation_id":"12efde92-4baf-4f4d-9937-f47678ccfd7f","resolution":{"observed_at":"2026-08-11T18:15:13.704671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.805911Z","title":"Remote sensing image scene classification: Benchmark and state of the art","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.805911Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:ace136c139324c83c8625f99fa902a13a4bb9af6cd612304a2516ca7b940cff1","observation_id":"020759e6-28e3-4368-8781-18109fdb74a8","resolution":{"observed_at":"2026-08-11T18:15:10.805911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.672163Z","title":"Zhao, Yanping Huang, Andrew M","venue":null,"work_id":"14414d89-a47f-4baa-8332-c40290ae4cfe","year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.812381Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:8e06e0792a4e2aca38c7febfc66c658da3b34fc0ea7d411ddb7cdacc4e97b4b4","observation_id":"b746629e-d543-4e30-a57a-d7ff5ec90582","resolution":{"observed_at":"2026-08-11T18:15:13.679730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.646268Z","title":"Model merging by uncertainty-based gradient matching","venue":null,"work_id":"4baa7535-b43f-4a6b-a5f1-d4834aaf9012","year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.820287Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:814ef91b2a635f41c858cef261bbb6cdcb1ebe2acdaacb9fc038214b0e4f112b","observation_id":"67ca8381-9653-4ef4-a298-33ec930f966a","resolution":{"observed_at":"2026-08-11T18:15:13.655628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.614826Z","title":"ColD fusion: Collaborative descent for distributed multitask finetuning","venue":null,"work_id":"f8717b7d-0ac4-435c-aec9-c525dbe8684d","year":2023},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.829496Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:2c7c32c5ca4ccfcddde0382a6ebec82800947c2ff06d5e68df6d9ac196ffec8a","observation_id":"7179bd36-8525-43e5-a84e-3d89372e9c13","resolution":{"observed_at":"2026-08-11T18:15:13.623970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.840168Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.840168Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:7ef4bcc372708aa6fe001cc7575c5d3492a36aa019a3f95efbc324bd7b4ed038","observation_id":"c2553b3d-71bd-40d3-950a-2e55aaecec7c","resolution":{"observed_at":"2026-08-11T18:15:10.840168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.564395Z","title":"GLaM: efficient scaling of language models with mixture-of-experts","venue":null,"work_id":"9fea0176-bcda-4c44-9105-eea7c9e0c4c2","year":2022},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.850405Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:db146f87c7e01712f45897308b5c02cfdd298e0584be2d6e4c0fc2b386a6b190","observation_id":"a46855af-b8df-4a75-b6c4-9bbb0d9283d2","resolution":{"observed_at":"2026-08-11T18:15:13.576240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.536636Z","title":"Durrant-Whyte and Mike Stevens","venue":null,"work_id":"68cced0a-1a71-4127-bf8d-b498bd4abd02","year":2001},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.858209Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:37aea998a4bd2f69f4101d049104afcabb259ba420489759efe23d4df32077f0","observation_id":"96aab1cc-4881-41ab-a5b4-8666dc84a3f4","resolution":{"observed_at":"2026-08-11T18:15:13.544903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.512191Z","title":"Knowledge card: Filling LLM s' knowledge gaps with plug-in specialized language models","venue":null,"work_id":"6c2cabcc-30eb-452e-bfb5-52f56b8cfe62","year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.865222Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:5a484a7be9170aaa9afd93b1acc03cfe5f73de2e20e2e36b163838476be93e2a","observation_id":"7db04345-154f-4cc2-9c3b-8e329aeeceaf","resolution":{"observed_at":"2026-08-11T18:15:13.519976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.479717Z","title":"Continual pre-training for cross-lingual LLM adaptation: Enhancing japanese language capabilities","venue":null,"work_id":"355c582f-2a66-454b-9a04-c4397227f9f6","year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.873089Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:4f24e8e672f0ce07b764b6ebeca1cebc7f7df8662f97e665105f95e2fcaeb24f","observation_id":"82690596-fd30-4d45-8362-8dae36fbafe3","resolution":{"observed_at":"2026-08-11T18:15:13.488184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-11T18:15:10.879522Z","title":"Gemma 2: Improving open language models at a practical size, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.879522Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:c3a91ceea554b7dec7987fbfe484aa8c04445dd86beaac363bda6dd7de2ec5ef","observation_id":"557a0e26-fc38-49c2-9823-140db3640a15","resolution":{"observed_at":"2026-08-11T18:15:10.879522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-11T18:15:10.886248Z","title":"Gemma: Open models based on G emini research and technology, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.886248Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:fad48738101387e5e64186a7ce54d51b9319bba1d8a8fff000053fbb612ab974","observation_id":"a6795780-5525-4f77-89a1-277feca12c6a","resolution":{"observed_at":"2026-08-11T18:15:10.886248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.453983Z","title":"Multi-loss weighting with coefficient of variations","venue":null,"work_id":"182d0c4b-fd1f-4e5b-a323-42be04771f20","year":2021},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.894295Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:8aa5f0400a90671310074ff5e9f9f7c15dd3e481d9f12a6e31c2b150f187b21d","observation_id":"81bc45e0-b04c-4bba-8969-4468630855b0","resolution":{"observed_at":"2026-08-11T18:15:13.461074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.900181Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.900181Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:b84753efc1bfda2169af1d3099b76c6f5e95727eae0c148bbd09a13a8a54c632","observation_id":"1183bd3c-63b1-4443-9971-171e25a6ffe4","resolution":{"observed_at":"2026-08-11T18:15:10.900181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/8519248","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.295883Z","title":"Euro SAT : A novel dataset and deep learning benchmark for land use and land cover classification","venue":null,"work_id":"be1da2e5-b8c1-4f5e-a0c2-80181bf47aa3","year":2019},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.907746Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:6d577dfaab5f1a0aaf3cdd43a0b9975abf98c8f56107a2c0d15245a32e64b03b","observation_id":"c1a94f2a-443b-4dcd-944e-13ad64eb79ec","resolution":{"observed_at":"2026-08-11T18:15:12.306623Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/6706807","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.102893Z","title":"Detection of traffic signs in real-world images: The G erman T raffic S ign D etection B enchmark","venue":null,"work_id":"e790317d-e91c-41e2-98a5-6e84ccbe854a","year":2013},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.913625Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:a2e49e29dbc6a3654785d897d00e8eca4da89f442c4ca29226b714e25607fc2c","observation_id":"c0d203fc-989a-4dd8-86ef-e7c0ef3ce1d2","resolution":{"observed_at":"2026-08-11T18:15:12.120608Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.427246Z","title":"Lo RA : Low-rank adaptation of large language models","venue":null,"work_id":"a245261c-9b41-4de9-8896-49a4748304eb","year":2022},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.919559Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:fad09fb09a5b29db0a80c91fb40344e5d5cd9f717ca16fbbcb9810bb93d7b956","observation_id":"572c2ceb-c933-4c12-ab1f-bd6df9ee96c8","resolution":{"observed_at":"2026-08-11T18:15:13.434148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.404980Z","title":"Editing models with task arithmetic","venue":null,"work_id":"b90b27e0-48aa-4659-8291-d78d68ccd28a","year":2023},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.926694Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:9ab6f055275b82921de0fbbfb80c38e99d4b53327dd03923ab2845ff5135bdae","observation_id":"f5eff7f6-483d-418f-afb6-437de8b88dc5","resolution":{"observed_at":"2026-08-11T18:15:13.413070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15361","last_updated":"2024-09-18T08:04:24Z","snapshot_observed_at":"2026-08-12T22:42:40.335825Z","submitted_at":"2024-09-18T08:04:24Z","title":"Multitask Mayhem: Unveiling and Mitigating Safety Gaps in LLMs Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15361","snapshot_observed_at":"2026-08-11T18:15:10.933257Z","title":"Multitask mayhem: Unveiling and mitigating safety gaps in LLM s fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.933257Z"},"links":{"cited_paper":"/paper/2409.15361","citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:486df96ca17ea66beb5dad22d3fd10748eba43b714c1f0b5533dca1baf6bad01","observation_id":"5c23cc78-7eea-49ca-9fe6-e439d8f52599","resolution":{"observed_at":"2026-08-11T18:15:10.933257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.372183Z","title":"ForkMerge : Mitigating negative transfer in auxiliary-task learning","venue":null,"work_id":"50437a14-5956-4ac9-83bf-7de38a9aaec9","year":2023},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.940131Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:8f02bf851e9317f41701580f0eb98142a1198d5e4ab72559922dfd55ad28e27a","observation_id":"7159d9cb-459c-40fc-9ebd-39ce6e83583b","resolution":{"observed_at":"2026-08-11T18:15:13.380992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.332363Z","title":"Dataless knowledge fusion by merging weights of language models","venue":null,"work_id":"91a83c57-eac4-4e3e-b3c1-8f9ed456f4ab","year":2023},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.947644Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:71e5bb6b0563d10a271c364acbcb27b2471007011135ac40eadac2bc26fb2894","observation_id":"710b5c2c-3aca-4774-b597-a91a5cea8dca","resolution":{"observed_at":"2026-08-11T18:15:13.342746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.291845Z","title":"The B ayesian learning rule","venue":null,"work_id":"26c8ea40-3881-4402-9b78-5e782c8c5af1","year":2023},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.953903Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:0972f8bac9e22e6b501abc77597b67edd80b9437d698f9e693023fbb8bc2b8e3","observation_id":"52f24e98-7fbd-4fdc-9b91-53599770f4bb","resolution":{"observed_at":"2026-08-11T18:15:13.301085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.264004Z","title":"Fast and scalable bayesian deep learning by weight-perturbation in Adam","venue":null,"work_id":"4ce11685-35c1-4941-b881-c06df54b5107","year":2018},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.962011Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:e0e22a709d880cfcac3ceee5a84d96238e9b98648b924f4f231c51e388142e18","observation_id":"8fda7099-3acd-4845-bf22-4f159185ae92","resolution":{"observed_at":"2026-08-11T18:15:13.272196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.970832Z","title":"3D object representations for fine-grained categorization","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.970832Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:a58f1e8135a1ae0dd400e74351b3718528e7fda2834964ab21e11426e7600116","observation_id":"485c367c-903d-41ef-a06c-9ff3e7bb601e","resolution":{"observed_at":"2026-08-11T18:15:10.970832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.230629Z","title":"Fast and simple natural-gradient variational inference with mixture of exponential-family approximations","venue":null,"work_id":"83e85713-c36b-4452-82ea-fd0c2fcdf35f","year":2019},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.976303Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:d0a84df46bf5f15a68f9e14193eeaf0c20224e6378a5b9dc0f2679e9733d896a","observation_id":"9b844140-3071-4f67-aa83-a82d2194c4c7","resolution":{"observed_at":"2026-08-11T18:15:13.242617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02303","last_updated":"2023-11-04T02:22:40Z","snapshot_observed_at":"2026-08-13T05:33:03.893916Z","submitted_at":"2023-11-04T02:22:40Z","title":"MFTCoder: Boosting Code LLMs with Multitask Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02303","snapshot_observed_at":"2026-08-11T18:15:10.982181Z","title":"MFTCoder : Boosting code LLM s with multitask fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.982181Z"},"links":{"cited_paper":"/paper/2311.02303","citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:aa7278f5ede3539728285a66d3c58e85a7a41f6b8cf4e6052a33349678d2352c","observation_id":"f98c6fc2-88a7-4804-ace3-584a4bf49310","resolution":{"observed_at":"2026-08-11T18:15:10.982181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-11T18:15:10.989779Z","title":"RoBERTa : A robustly optimized BERT pretraining approach, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.989779Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:41bc795fa282ed3a16af64daedb1b3625711c7b8dfc5b889895f76fca7c21e28","observation_id":"74a37287-ab42-4f70-94a1-ed5ce9090c0a","resolution":{"observed_at":"2026-08-11T18:15:10.989779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.996890Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.996890Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:b21432b8b57f470e2ddea6792066b50d5fecfdde2f329d0e42284a9760fa8cd0","observation_id":"8c533a58-f88e-41f7-9cf2-fbe53f4d06d8","resolution":{"observed_at":"2026-08-11T18:15:10.996890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.174389Z","title":"Maas, Raymond E","venue":null,"work_id":"bf9846da-4d35-4843-bacd-c0113c8cc253","year":2011},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.004139Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:91e3a335e6537795253826f4962e6d13d9621ce25d8da02234ee4e3555710cd8","observation_id":"fea2f85d-a94f-4872-ae6f-11c520ffe25c","resolution":{"observed_at":"2026-08-11T18:15:13.182130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16235","last_updated":"2024-09-24T16:51:36Z","snapshot_observed_at":"2026-08-12T22:38:28.195671Z","submitted_at":"2024-09-24T16:51:36Z","title":"EuroLLM: Multilingual Language Models for Europe","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16235","snapshot_observed_at":"2026-08-11T18:15:11.010961Z","title":"Guerreiro, Ricardo Rei, Duarte M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.010961Z"},"links":{"cited_paper":"/paper/2409.16235","citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:2d830afb25ee3184a33b1c28837bf8f81a60aa2ac60356772584b347e4b6087f","observation_id":"0bcd4f09-389d-4ca9-a158-77b305fec2c1","resolution":{"observed_at":"2026-08-11T18:15:11.010961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.137865Z","title":"Merging models with F isher-weighted averaging","venue":null,"work_id":"df3430e7-e3da-4775-8cd3-0306a174d154","year":2022},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.018531Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:7b718eb0a88b9d273b5d6a23dbf286f6adcc4c0f97c78b69360d8a0946e9399b","observation_id":"3fa8acdd-d773-454f-862a-c982f0af8528","resolution":{"observed_at":"2026-08-11T18:15:13.145525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:11.024309Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.024309Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:9230b5b307eba05b9f96d9a8ae046c44c674997c5120b27c146d6e292b2f2a71","observation_id":"f98b26df-4d7c-4dab-bb20-a2440de62d48","resolution":{"observed_at":"2026-08-11T18:15:11.024309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"book/9780849","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:11.696579Z","title":null,"venue":null,"work_id":"ee3d89fa-c963-45d2-b314-0936f4c2c53f","year":1998},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.030817Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:015a4975b99e1e126459028ff30d6ef438fc58fcdf7cec337acbca19dcbab566","observation_id":"e469d320-642d-4df6-a0ad-027c149e448c","resolution":{"observed_at":"2026-08-11T18:15:11.708518Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.109415Z","title":"Reading digits in natural images with unsupervised feature learning","venue":null,"work_id":"019ae74b-4d85-4d15-94ec-a92383e4d8a0","year":2011},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.038823Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:104ba9b19a5e30633c653fb98f7cf172fc5815f729abd2fc18f40db1a94ef9b0","observation_id":"ad718209-7434-42be-a598-4f2e7c83f624","resolution":{"observed_at":"2026-08-11T18:15:13.115920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:11.045381Z","title":"The variational gaussian approximation revisited","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.045381Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:a953d5bbbd0a184c3c43cb6bddf7aac40cb24052c1d5b6f613a38e600c23c5a0","observation_id":"ac059a11-33d3-430f-8586-0df75f5a2bfb","resolution":{"observed_at":"2026-08-11T18:15:11.045381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.058756Z","title":"Task arithmetic in the tangent space: Improved editing of pre-trained models","venue":null,"work_id":"8b69ea93-243a-4d08-ba06-500f3f587274","year":2023},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.050804Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:812ed812146e47d66171dd4b9a478ba80a28660d0cd961d910e0c9ece5c35fed","observation_id":"5647c61b-0e2a-477b-8edc-4ffd8649f13d","resolution":{"observed_at":"2026-08-11T18:15:13.070218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.033732Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"366238a9-f8c6-4ef1-a953-27180bde86ff","year":2022},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.059099Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:30dc61ab7ae97adadd0e7bde420537837e297f83f0ac4b782a17d0e8ae47048d","observation_id":"9f8a06f5-d6a4-4b8b-9474-c4fde8e006ee","resolution":{"observed_at":"2026-08-11T18:15:13.042210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.997033Z","title":"Seeing stars: Exploiting class relationships for sentiment categorization with respect to rating scales","venue":null,"work_id":"4f22ad15-baec-47d6-8f0c-b7c1f0bd9339","year":2005},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.065388Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:febed5bba56bbd31c3912aed91bbce931910edf9aa3c0d66406834d452871111","observation_id":"b8e9ae59-116f-4e3a-95ae-c74eb59673b0","resolution":{"observed_at":"2026-08-11T18:15:13.006404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.960535Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to! In International Conference on Learning Representations (ICLR), 2024","venue":null,"work_id":"29e3cb21-8abf-4747-9014-1e83ffe31c1f","year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.072473Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:acab17d007f0c146ef4746c423d26a65d5c26acf9ae48016731c27d728bb836e","observation_id":"c5436ae4-1b90-417c-ba7d-a69db06a26d5","resolution":{"observed_at":"2026-08-11T18:15:12.968269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.935204Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"73bef672-2691-4a20-9a9f-7db11a0e5cae","year":2021},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.078934Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:b625cee778140c4fbbce7da1078f37b2947099b3cac21b7cdcc157a51048a0ed","observation_id":"6baa1d97-31aa-4c8b-a2f8-46c822a4b443","resolution":{"observed_at":"2026-08-11T18:15:12.943881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.897503Z","title":null,"venue":null,"work_id":"1c463717-dc1e-497b-a19b-43f7d9ed9ea0","year":2020},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.085942Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:b4f6fd9041f18a28b101d012bcfeea3a90237db68dbe036d1029ca2c66bdd752","observation_id":"9eec02c0-f56e-4f67-abef-976c2257cc97","resolution":{"observed_at":"2026-08-11T18:15:12.907624Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.869362Z","title":"Learning to reweight examples for robust deep learning","venue":null,"work_id":"d71dd6cb-c910-4344-b5f7-2c33c67e9a27","year":2018},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.093757Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:4b19192eb21826d238ebb9a01a5c14442c1041f1ec9cf12ed77255b33086495f","observation_id":"b0c52ace-ab0d-4a77-bd1a-98b00360b063","resolution":{"observed_at":"2026-08-11T18:15:12.877091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05098","last_updated":"2017-06-15T21:38:12Z","snapshot_observed_at":"2026-08-13T21:53:02.384757Z","submitted_at":"2017-06-15T21:38:12Z","title":"An Overview of Multi-Task Learning in Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05098","snapshot_observed_at":"2026-08-11T18:15:11.101238Z","title":"An overview of multi-task learning in deep neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.101238Z"},"links":{"cited_paper":"/paper/1706.05098","citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:971bef46c576e27c116302bef6a0a8503f1e920b879a7b5b7850af4611dee02d","observation_id":"bd4f4ced-f41a-442a-b3a5-228868419e38","resolution":{"observed_at":"2026-08-11T18:15:11.101238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.829060Z","title":"Variational learning is effective for large deep networks","venue":null,"work_id":"bf24e597-2d89-45cf-96ad-56a592227b00","year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.107479Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:35ef7b302d54c36ac825bc72450ad572aa25eab64d3c4dacfbbb00034fedb2b0","observation_id":"19f589c9-c697-428a-a2d7-deafa1fc82c7","resolution":{"observed_at":"2026-08-11T18:15:12.841471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.793482Z","title":"Manning, Andrew Ng, and Christopher Potts","venue":null,"work_id":"7133778c-bfda-408b-a99f-ad7764e9aec5","year":2013},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.112906Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:c7e613fd86af17e7aedd85c8fddccf8b216546972df153b04fb3837ff6ecac2d","observation_id":"5450d75e-ee04-4d28-bdd3-7c9bff97333b","resolution":{"observed_at":"2026-08-11T18:15:12.801207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.763583Z","title":"ZipIt! M erging models from different tasks without training","venue":null,"work_id":"08efd12d-3ce2-4f93-9063-732db039f6b5","year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.119063Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:6af89d8abecd8a32e9b8fb0e293c0913ea43c6d6136cc429151d21bb998688fe","observation_id":"8e03159c-696c-4e1c-b959-13f944dabfaf","resolution":{"observed_at":"2026-08-11T18:15:12.771096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.730169Z","title":"Self-influence guided data reweighting for language model pre-training","venue":null,"work_id":"a1cbfd6c-40d7-421d-a242-55ec946153ca","year":2023},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.124939Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:6b772232844e373285649b63edcae1938a621632962f503a0703af4ab3fab1ac","observation_id":"9a1db191-e886-4f29-84d9-efceb07a0918","resolution":{"observed_at":"2026-08-11T18:15:12.743621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.697396Z","title":"A B ayesian committee machine","venue":null,"work_id":"a735501c-80d6-4e1f-be71-2c7032486982","year":2000},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.131511Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:16a9a0f3a799baff8e230c16d1d9a1c1483c702ffc4cf58751a69d75c95cb588","observation_id":"b02077f1-2c83-4e16-9927-6af9930972b8","resolution":{"observed_at":"2026-08-11T18:15:12.706744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.666865Z","title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","venue":null,"work_id":"cb360fcb-8fab-4c74-8a6e-4514ff794e69","year":2022},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.139994Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:fc26717e7ad757345126ef0eb311e8aa4ce882d2d4fd49d7794708a5b791369d","observation_id":"c2478687-5d2f-4d51-b170-201bdb0ea5cf","resolution":{"observed_at":"2026-08-11T18:15:12.674500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/5539970","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:11.498816Z","title":"Ehinger, Aude Oliva, and Antonio Torralba","venue":null,"work_id":"a07146d7-b502-4f1b-a079-a9c6e2eb9b3f","year":2010},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.146569Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:266dcec3c7c5f0726b1bbd8346d6624aba96f644b6e15b7c879e18e03f61d285","observation_id":"cfd7f9dc-8af2-40c3-b6f9-9428fea2ec56","resolution":{"observed_at":"2026-08-11T18:15:11.511223Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.637505Z","title":"Data selection for language models via importance resampling","venue":null,"work_id":"8716199b-28de-4379-82a9-b64bc127243d","year":2023},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.152454Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:d064c5f915c7a4cc290f4e9357ead5ec61e5936f0b27c991838f3b34af9ca432","observation_id":"2585dbbb-1bae-4423-9ed7-200b9bfb7d54","resolution":{"observed_at":"2026-08-11T18:15:12.645460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.606002Z","title":"Towards few-shot adaptation of foundation models via multitask finetuning","venue":null,"work_id":"0c4cb56e-6fb7-412a-a9f9-41093c70e5a5","year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.158372Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:5dd028fa89a9fc06a9606b779ce96fcf74a5d15d6f161dac4b9c8a24105d0d8f","observation_id":"97340a3b-6d14-49f4-b3a1-e7611ffe84e8","resolution":{"observed_at":"2026-08-11T18:15:12.612745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.01719","last_updated":"2022-07-20T03:27:47Z","snapshot_observed_at":"2026-08-13T16:47:45.904751Z","submitted_at":"2022-02-03T17:36:07Z","title":"FORML: Learning to Reweight Data for Fairness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.01719","snapshot_observed_at":"2026-08-11T18:15:11.167948Z","title":"FORML : Learning to reweight data for fairness","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.167948Z"},"links":{"cited_paper":"/paper/2202.01719","citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:ebb18ff0efa8862c11b8a8f1b8cf912f22efee14ec5925d7b25fe791b4c38207","observation_id":"602dd2c2-18fe-439b-97ff-1b0e5729ae93","resolution":{"observed_at":"2026-08-11T18:15:11.167948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.572525Z","title":"Adamerging: Adaptive model merging for multi-task learning","venue":null,"work_id":"93cd0922-3dd5-46eb-8cde-449de3fb4c0e","year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.174240Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:508fc4e78ffa8c8d5986cd1e1e84b8e5b84a102cd72502e555884fbf576d9627","observation_id":"223edb0f-e7c1-4a25-abae-67512cab4bec","resolution":{"observed_at":"2026-08-11T18:15:12.582686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:11.179853Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.179853Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:637633d24d0a308a39f8bd51d170f0bba58b20e36165dfa7feb8684d533abb91","observation_id":"d3ace85e-fbb7-45a0-94b8-f3fafe13ce02","resolution":{"observed_at":"2026-08-11T18:15:11.179853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.542263Z","title":"Character-level Convolutional Networks for Text Classification","venue":null,"work_id":"cf4721ec-e3ff-4821-81ba-5465d984f78d","year":2015},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.185463Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:f4da487cc2009f184250f80526fcbf0ed4098c93ea001b024d52d19467477e6c","observation_id":"be6e1a6e-b594-4cd3-9ea2-f81b0733a5a0","resolution":{"observed_at":"2026-08-11T18:15:12.548796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T12:39:00.918390Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":4,"verified_fuzzy":41},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 1 inbound Pith citation observation for arXiv:2412.08147."}